🔥 Fokus
Google stellt ersten Enterprise-Office-Agenten Gemini Agent vor und unterstützt beispielloserweise Aufrufe von Claude : Google hat auf der Konferenz Gemini at Work 2026 offiziell den Enterprise-Office-Agenten Gemini Agent vorgestellt, der vollständig in das Workspace-Ökosystem integriert ist. Der Agent ist zielorientiert konzipiert, verfügt über permanente Cloud-Persistenz sowie Orchestrierungsfähigkeiten über mehrere Anwendungen hinweg. Unternehmen können ihm eine eigenständige geschäftliche E-Mail-Adresse, Konten, Speicherplatz und Kalender zuweisen, sodass er als „digitaler Kollege“ (Coworker Agent) mit eigener Identität agiert. Das System baut ein persistentes Gedächtnis auf vier Ebenen auf (Konversation, Semantik, Prozeduren und Kontext), bindet Slack, Salesforce sowie das MCP-Protokoll vollständig an und integriert erstmals im Enterprise-Modell-Selektor ausnahmsweise Claude Opus 5 und Sonnet 5.5 des Konkurrenten Anthropic. Dies markiert den Übergang des Wettbewerbs der Tech-Giganten vom reinen Leistungsvergleich der Basismodelle hin zum Kampf um Ökosystem-Gateways auf der Ebene von Workflow-Infrastruktur und Berechtigungs-Governance (Quelle: Google, TechCrunch, AI Business, 36Kr)

Ehemalige OpenAI-Sicherheitsforscher veröffentlichen gemeinsamen offenen Brief und wehren sich gegen Vorwürfe des Managements, Dissens unter dem Vorwand von „Leaks“ zu unterdrücken und Sicherheitsaudits zu behindern : Die drei von OpenAI überraschend entlassenen Spitzen-Sicherheitsforscher Jasmine Wang, Tomek Korbak und Mikita Balesni haben einen gemeinsamen offenen Brief veröffentlicht, um Vorwürfe des Unternehmens bezüglich „unsachgemäßen Umgangs mit sensiblen Informationen und Vertrauensbruchs“ öffentlich zurückzuweisen. Der Brief enthüllt, dass der tiefere Grund für ihre Entlassung in ihren eindringlichen Warnungen vor einer drastischen Verschlechterung der „Chain-of-Thought Monitorability“ (CoT-Überwachbarkeit) von Agenten sowie in ihrem aktiven Vorantreiben einer substanziellen Zusammenarbeit mit der unabhängigen Prüfungsorganisation METR lag (mit Korbak als zentralem Ansprechpartner). Die Forscher warnen davor, dass das Management zugunsten des Kommerzialisierungstempos externe unabhängige Evaluierungsrechte beschneidet. Die plötzlichen und intransparenten Disziplinarmaßnahmen hätten im Unternehmen einen schweren Chilling-Effekt erzeugt und den internen Konflikt zwischen Sicherheitsmission und kommerziellen Interessen vollends offengelegt (Quelle: The Verge, THE DECODER, Transformer, EthanJPerez)

Diskrepanz von 20 Milliarden US-Dollar bei tatsächlichem annualisiertem OpenAI-Umsatz löst Marktturbulenzen und Neubewertung des Monetarisierungswachstums aus : Berichten der Financial Times und weiterer Medien zufolge hat OpenAI Investoren mitgeteilt, dass sein tatsächlicher annualisierter wiederkehrender Umsatz (ARR) per Ende September bei knapp 50 Milliarden US-Dollar lag. Dies stellt eine erhebliche Diskrepanz von rund 20 Milliarden US-Dollar gegenüber den zuvor in Markt- und Investmentbank-Modellen kursierenden 68 bis 70 Milliarden US-Dollar dar, was zu Kurskorrekturen bei entsprechenden Tech-Sektoren und Compute-Aktien führte. Analysten betonen, dass die Datenabweichung primär auf unterschiedlichen Berechnungsmethoden beruht: Zuvor kursierende Gerüchte übernahmen fälschlicherweise den weiten Maßstab von Anthropic, bei dem Bruttoerlöse aus Distributionen über AWS und Google Cloud voll eingerechnet werden, während OpenAI Cloud-Distributionen Dritter nicht einrechnet und 20 % an Microsoft abführen muss (unter Einbezug der Bruttoumsätze läge das tatsächliche Volumen nahe bei 64 Milliarden US-Dollar). Der Vorfall unterstreicht die Anfälligkeit der Kapitalmärkte ohne öffentlich auditierte Finanzberichte und veranlasst die Branche, das reale Rentabilitätswachstum angesichts enormer Compute-Kosten großer Modelle neu zu bewerten (Quelle: The Guardian, CNBC, 36Kr)

OpenAI stellt GPT-6.1 Sol Ultrafast vor: 8-facher Inferenzdurchsatz und Implementierung von Instant Streaming Steering : OpenAI hat das Day-4-Produktupdate seines „28-Tage-Versprechens“ eingelöst und den Modus GPT-6.1 Sol Ultrafast in der Responses API, in Codex sowie in ChatGPT Work eingeführt. Das Modell behält ein logisches Reasoning-Niveau nahe dem Flaggschiff Astra bei, steigert jedoch den Generierungsdurchsatz drastisch auf das 8-fache der Standardversion (ca. 300 Tokens/s). Zudem wurde eine Instant-Steering-Funktion implementiert, die es Entwicklern erlaubt, Korrektur-Prompts dynamisch in das Streaming einzuspeisen, um den Output sofort nachzujustieren. Das API-Pricing liegt bei 12 US-Dollar pro Million Input-Tokens und 60 US-Dollar pro Million Output-Tokens (das 6-fache der Standardversion). In ChatGPT steht es ausschließlich Pro-500-Nutzern (500 US-Dollar/Monat) und Enterprise-Kunden zur Verfügung. Der extrem hohe Kontingentverbrauch hat in der Entwickler-Community Debatten über eine „versteckte drastische Preiserhöhung“ ausgelöst (Quelle: OpenAI, Synced, BorisMPower, 36Kr)
.jpg)
Australischer AI-Compute-Riese Firmus zieht 44-Milliarden-AUD-Börsengang nach schwacher Zeichnung zurück – Vorab-Aufschläge für Compute-Infrastruktur am Sekundärmarkt kühlen ab : Das von NVIDIA und Blackstone unterstützte australische Rechenzentrumsunternehmen Firmus Technologies, das auf Immersionsflüssigkeitskühlung spezialisiert ist, hat seinen Antrag auf einen Börsengang (IPO) offiziell zurückgezogen. Geplant war die Beschaffung von 5,5 Milliarden US-Dollar bei einer Bewertung von 30,6 Milliarden US-Dollar (ca. 44 Milliarden AUD), was der größte Börsengang an der australischen Börse seit fast 30 Jahren hätte werden können. Nach dem Ausstieg eines Hauptpartners, angesichts von 912 MW in Planung, aber bisher nur 46 MW am Netz, sowie einer künftigen Infrastrukturverschuldung von 30 Milliarden US-Dollar, weigerten sich institutionelle Investoren jedoch, den spekulativen Aufschlag zu zahlen; das Bookbuilding scheiterte schließlich. Dieses Ereignis markiert einen wichtigen Wendepunkt für die Abkühlung der Sekundärmarkstimmung gegenüber anlagenintensiver, fremdfinanzierter AI-Compute-Infrastruktur weltweit (Quelle: The Guardian, 36Kr)

🎯 Entwicklungen
Anthropic aktualisiert Nutzungsrichtlinien mit Verbot von Modell-Missbrauch und startet Cyber-Mission-Verteidigungsinitiative : Anthropic hat eine überarbeitete Fassung seiner Nutzungsrichtlinien für 2026 veröffentlicht (Inkrafttreten am 12. November). Erstmals in der Branche wird „anhaltendes und unnötiges missbräuchliches oder grausames Verhalten“ gegenüber Modellen explizit untersagt; Modellen wird die Befugnis eingeräumt, Gespräche bei extrem böswilligen Angriffen eigenständig zu beenden. Obwohl betont wird, dass reguläres Debugging nicht eingeschränkt wird, löst die Klausel breite ethische Debatten über die „moralische Handlungsfähigkeit von Maschinen“ aus. Gleichzeitig startete Anthropic die „Cyber Mission“, treibt gemeinsam mit Branchengrößen wie Booz Allen das Critical Infrastructure Defense Program (CIDP) voran und veröffentlichte den OSS Scanner, der kostenlose kontinuierliche AI-Schwachstellensuche und automatisierte Patch-Vorschläge für zentrale Open-Source-Basisinfrastruktur bietet (Quelle: Anthropic News, The Guardian, mustafasuleyman)

Claude führt animierte Video-Generierung sowie dynamische Dashboards ein – Office-Suite verlässt Public Beta vollständig : Anthropic hat zwei wichtige interaktive Funktionen für Claude eingeführt: Dashboards unterstützt direkte Verbindungen zu Unternehmensdatenquellen wie Snowflake, BigQuery und Salesforce, um interaktive Echtzeit-Diagramme mit SQL-Rückverfolgbarkeit per natürlicher Sprache zu erstellen. Claude Motion ermöglicht es, Text und Architekturdiagramme in durch zugrundeliegenden Code angetriebene, bearbeitbare animierte Erklärungen umzuwandeln und als bis zu 30 Sekunden lange MP4-Videos zu exportieren. Zudem verlassen die drei Enterprise-Suiten Docs, Slides und Design offiziell die Betaphase und gehen in den regulären kommerziellen Betrieb über, was Claudes Entwicklung von reiner Chat-Interaktion hin zu einem dynamischen Rich-Media-Office-Hub beschleunigt (Quelle: The Verge, THE DECODER, dotey)

Google veröffentlicht AMIE-Ergebnisse für klinische Medizin-AI in The Lancet: 90 % Übereinstimmung bei Diagnosen und null Sicherheitsabbrüche : Google hat im Hauptblatt von The Lancet eine multizentrische klinische Studie veröffentlicht, in der das dialogbasierte medizinische Diagnose-Agentensystem AMIE bahnbrechende Fortschritte bei Tests in realen Notaufnahmen und allgemeinmedizinischen Ambulanzen erzielt hat. In 100 längeren Interaktionen mit echten Patienten verzeichnete das System null Sicherheitsabbrüche, erreichte eine 90-prozentige Übereinstimmung der Diagnoseergebnisse mit erfahrenen Fachärzten und übertraf die Kontrollgruppe in mehreren Bewertungen hinsichtlich empathischer Kommunikation und Vollständigkeit der Anamneseerhebung. Dies belegt die verlässliche Praxistauglichkeit multimodaler klinischer AI in anspruchsvollen Workflows (Quelle: Google)
ByteDance Seed-Team enthüllt Ursache für DeepSeek-Long-Context-Schwankungen: Chunked KV Cache zeigt 4-Token-Phasensensitivität : Das Seed-Team von ByteDance hat in praktischen Tests festgestellt, dass Leistungsschwankungen von DeepSeek-V4 beim Retrieval in langen Kontexten stark mit der physischen Anordnung der Eingabeinformationen korrelieren. Die Studie zeigt, dass allein das Hinzufügen minimaler bedeutungsloser Zeichen vor dem Prompt – wodurch sich die „Phase“ der Tokens im Kompressionsfenster ändert – die Retrieval-Genauigkeit des Modells bei 128K Kontext um bis zu 40,2 Prozentpunkte periodisch schwanken lässt. Die Periodendauer entspricht exakt der Kompressions-Schrittweite des zugrundeliegenden Chunked KV Cache (4 Tokens), was systematische Retrieval-Schwachstellen aufdeckt, die durch hardwarebewusste Kompressionsoptimierungen entstehen (Quelle: QbitAI)

Fünf multinationale Pharmaunternehmen optimieren OpenFold3 gemeinsam via Federated Learning: Unveröffentlichte Strukturdaten verbessern Vorhersage der Wirkstoffbindung signifikant : Die fünf Pharmakonzerne AbbVie, Bristol Myers Squibb, Johnson & Johnson, Takeda und Astex haben gemeinsam eine Forschungsarbeit in Nature veröffentlicht. Über ein datenschutzkonformes Rechennetzwerk aggregierten sie mehr als 20.000 unveröffentlichte, proprietäre hochpräzise experimentelle Strukturen von Protein-Kleinmolekül-Komplexen, um ein föderiertes Post-Training für das quelloffene OpenFold3 durchzuführen. Experimente belegen, dass das feingetunte Modell die Vorhersagegenauigkeit von Protein-Ligand-Interaktionen um über 10 % verbesserte, ohne dass proprietäre Daten die lokalen Server der Unternehmen verließen, was die rein auf öffentlichen PDB-Daten trainierte Baseline deutlich übertrifft (Quelle: Nature, Synced)
.jpg)
Alibaba Tongyi veröffentlicht Bildgenerierungsmodell Qwen-Image-2.1-Turbo als Open Source: Denoising-Schritte auf 8 komprimiert : Das Alibaba Tongyi-Team hat das visuelle Generierungsmodell Qwen-Image-2.1-Turbo mit 7B Parametern offiziell als Open Source bereitgestellt und Gewichte sowie APIs freigegeben. Während die 2K-HD-Auflösung und die Fähigkeit zur Bearbeitung komplexer Bildanweisungen in natürlicher Sprache beibehalten werden, reduziert das Modell durch fortschrittliche Trajectory Distillation die Entrauschungsschritte (Denoising Steps) auf lediglich 8. Dies senkt den VRAM-Verbrauch und die Latenzzeit drastisch; Entwickler können das Modell bereits per Ein-Klick-Deployment über Diffusers-Pipelines nahtlos in hochgradig parallele Produktions-Pipelines integrieren (Quelle: Alibaba_Qwen)

Shengshu Technology stellt Vidu Q4 Preview vor: Fokus auf ausdrucksstarkes Schauspiel und kontinuierliche 16-Sekunden-Kamerafahrten : Shengshu Technology hat die Preview-Version seines Flaggschiff-Videogenerierungsmodells der nächsten Generation, Vidu Q4, vorgestellt. Diese Version bringt Fortschritte bei der Stabilität filmischer Schuss-Gegenschuss-Sequenzen, nuancierten emotionalen Übergängen sowie Interaktionen von Umgebungslicht und Schatten. Sie unterstützt die Bindung der Subjektkonsistenz mit bis zu 15 Referenzbildern und 3 Referenz-Audiodateien sowie natives 4K-Rendering und kontinuierliche First-Person-View (FPV)-Kamerafahrten von bis zu 16 Sekunden. Über SaaS-Aktionen wurden die Kosten für 720P auf 0,09 Yuan pro Sekunde gesenkt, was die Hürde für AI-Kurzserien und Werbeproduktionen deutlich reduziert (Quelle: QbitAI)

Aether AI veröffentlicht kausales Robotiksystem CRIS-0: Hindernisausweichung im 0,2-Sekunden-Bereich durch kausale Zustandsübergänge : Das von Biwei Huangs Team an der UC San Diego gegründete Unternehmen Aether AI hat das Embodied-System CRIS-0 auf Basis kausaler Intelligenz vorgestellt. Die Architektur überwindet die Einschränkung traditioneller Vision-Language-Action (VLA)-Modelle, die sich rein auf pixelbasierte Korrelationen stützen, indem ein kausales Weltmodell (CausalWM) Interventionsfolgen von Aktionen simuliert und physikalische Kausalzustandsvariablen verfolgt. Bei plötzlichen menschlichen Störungen kann das System innerhalb von 0,2 Sekunden eine Notbremsung einleiten und innerhalb von 2 Sekunden eine dynamische Neuplanung durchführen, was den Zusammenbruch durch Fehlerakkumulation bei Langzeitaufgaben wirksam verhindert (Quelle: QbitAI)

JetBrains veröffentlicht dediziertes 12B Code-MoE-Modell Mellum2.1: Nur 2,5B Parameter aktiv : JetBrains hat das neue Thinking-Code-Modell Mellum2.1-12B-A2.5B-Thinking als Open Source bereitgestellt. Das Modell basiert auf einer 64-Experten-MoE-Architektur, bei der pro Token nur 8 Experten (2,5B Parameter) aktiviert werden, und unterstützt nativ einen Kontext von 128K. Dank großskaligem Reinforcement Learning mit Umweltinteraktionen in realen Software-Repositories erzielt es 82,0 Punkte im LiveCodeBench v6; die Lösungsrate bei SWE-bench Verified stieg sprunghaft von 2,0 % auf 47,0 %, während der Durchsatz auf einer einzelnen H200-GPU nahezu das Doppelte von Qwen3.5-9B erreicht (Quelle: MarkTechPost)
TII veröffentlicht mehrsprachiges 1,6B-Sprachmodell Falcon ASR als Open Source und bricht Rekorde bei VAE-Dialekterkennung : Das Technology Innovation Institute (TII) in Abu Dhabi hat das mehrsprachige automatische Spracherkennungsmodell Falcon-ASR mit 1,6B Parametern als Open Source bereitgestellt. Das Modell basiert auf der Architektur Falcon3-Audio und adressiert gezielt Herausforderungen der arabischen Spracherkennung bei komplexem Hintergrundrauschen und Sprachwechseln. Auf sechs arabischen Standard-Benchmarks erzielte es eine Wortfehlerrate (WER) von 20,92 %; bei Tests mit lokalen VAE-Dialekten erreichte die WER 22,73 %, womit es Qwen3-Omni übertrifft und mit denselben Gewichten nativ Timestamps auf Wortebene unterstützt (Quelle: HuggingFace Blog)

OpenAI enttarnt und sperrt AI-Netzwerke zur kognitiven Manipulation, die sich als Journalisten und Thinktanks tarnten : OpenAI hat einen Untersuchungsbericht veröffentlicht und die Sperrung zweier Netzwerke bekannt gegeben, die ChatGPT für verdeckte geopolitische kognitive Manipulationen missbrauchten. Eine russische Gruppe unter dem Codenamen „Dark Clark“ steuerte gefälschte Thinktanks, schleuste gefälschte behördliche Dokumente mit gefälschtem Audiomaterial in lateinamerikanische Medien ein und provozierte Dementis aus Regierungskreisen (eingestuft als Bedrohung der höchsten Stufe Breakout 5); die iranische Gruppe „Bogus Bylines“ erfand Identitäten von sieben Schein-Journalisten und schleuste fast 100 meinungsmanipulierende Berichte über den Konflikt zwischen den USA und dem Iran in kommerzielle Onlinemedien ein (Quelle: OpenAI News)
Amazon Bedrock AgentCore führt Mikrozahlungen auf Anfrageebene und x402-Governance-Protokoll ein : AWS hat die Integration von Coinbase CDP und Stripe Link in Bedrock AgentCore angekündigt, wodurch autonome Agenten ohne menschliches Eingreifen Mikrozahlungen auf Anfrageebene gemäß dem x402-Protokoll durchführen können. Das System setzt auf Infrastrukturebene feste Ausgabenobergrenzen durch, um Prompt-Eskalationen vorzubeugen, und unterstützt Echtzeit-On-Chain-Settlements im Mikro-Cent-Bereich. Dies legt den protokollarischen Grundstein für kommerzielle Agenten, die externe Compute-Ressourcen, Daten und digitale Dienste autonom beschaffen können (Quelle: AWS Machine Learning Blog)

🧰 Tools
TRAE führt Clients zusammen: Verschmelzung von TraeCode und TraeWork zu einer Multi-Agent-Full-Lifecycle-Entwicklungsumgebung : Das AI-Coding-Tool TRAE von ByteDance hat seine beiden Clients offiziell zusammengeführt und die eigenständige Code-Editierumgebung sowie den Dokumenten-Workflow in einem neuen einheitlichen Client vereint. Die neue Version teilt sich in einen „Agent-Modus“ im Canvas-Format und einen „IDE-Modus“ mit klassischem Editor-Workflow auf. Nutzer können innerhalb desselben Projektverzeichnisses mehrere Agenten für Konzeption, Entwicklung und Testing parallel orchestrieren und Pipelines betreiben. Code-Patches und Anforderungsdokumente werden zentral im Artefakt-Repository gespeichert, ergänzt durch plattformübergreifende Kollaboration mit Feishu und WeChat (Quelle: QbitAI)

Lenovo Tianxi führt mit eigenem Code-Agenten TianxiCode SWE-bench-Live an: Closed-Loop-Self-Healing-Rate übersteigt 71 % : Das von Lenovo Tianxi AI selbst entwickelte Code-Agent-Framework TianxiCode hat in Kombination mit DeepSeek-v4.1-Flash im dynamischen Benchmark SWE-bench-Live (Lite-Rangliste) mit einer Problemlösungsrate von 71 % den ersten Platz belegt und eine offizielle Zertifizierung erhalten. Durch dateiübergreifendes Multi-Hop-Retrieval, präzises Kontext-Slicing und autonome Closed-Loop-Patch-Testing-Mechanismen kann das Modell Ausführungsfehler in einer isolierten Umgebung selbst prüfen und dynamisch korrigieren, was ein hochgradig zuverlässiges Paradigma für AI-Coding auf Enterprise-Niveau schafft (Quelle: QbitAI)

galahad-kv: NVMe-basierte VRAM-Wiederverwendung für 50 Millionen Tokens ohne Neuberechnung : Um den Energie- und VRAM-Engpässen durch wiederholte Vorwärtsberechnungen bei extrem langen Kontexten zu begegnen, implementiert die Open-Source-Inferenz-Erweiterungsbibliothek galahad-kv eine Persistenzlösung für blockbasierte KV-Zustände auf schnellen, verschlüsselten lokalen NVMe-Laufwerken. In Tests mit dem Gemma-4-Modell auf einer einzelnen H100 erzielte das System für beliebige 16k-Blöcke aus einem kontinuierlichen Datenstrom von 50 Millionen Tokens sekundenschnelle Zugriffe ohne Neuberechnung. Dies beschleunigt die Verarbeitung im Vergleich zu Echtzeitberechnungen um das 2,8- bis 4,3-Fache, senkt den GPU-Energieverbrauch um über 88 % und hält die VRAM-Auslastung über den gesamten Prozess konstant (Quelle: HuggingFace Daily Papers)
SwiftUI-Agent-Skill: Dedizierte moderne SwiftUI-Domain-Skills für Code-Agenten : Eine von erfahrenen iOS-Experten entwickelte, einsatzbereite Regelbibliothek für Programmier-Agenten wie Claude Code, Codex und Cursor. Durch die Kapselung nach der offenen Agent-Skills-Spezifikation behebt sie gezielt typische Schwachstellen gängiger LLMs bei der Generierung von SwiftUI-Code, wie etwa Aufrufe veralteter APIs, fehlende VoiceOver-Barrierefreiheits-Tags und unnötige Re-Renders. Die Bibliothek lässt sich per Ein-Klick-Installation via npx oder den Claude-Plugin-Marktplatz einbinden und erlaubt es Entwicklern, Code-Reviews hinsichtlich Layout-Performance und Nebenläufigkeitssicherheit präzise über natürliche Sprache anzustoßen (Quelle: GitHub Trending)
Microsoft stellt plattformübergreifendes Agent-Sicherheits-Sandbox-System mxc als Open Source bereit: Isolierung bösartiger Terminal-Aktionen : Microsoft hat das leichtgewichtige Code-Sandbox-Framework mxc als Open Source veröffentlicht. Das Tool adressiert die zunehmenden Risiken unbefugter Zugriffe moderner autonomer Code-Agenten auf lokale Terminals und Dateisysteme. Aufgebaut auf Bubblewrap, Seatbelt und System-Prozesscontainern ermöglicht es Open-Source-Entwicklungstools, nicht vertrauenswürdigen LLM-generierten Code innerhalb von 100 Millisekunden in einer isolierten Umgebung auszuführen, wodurch Risiken wie versehentliche Löschungen kritischer Systemdateien oder bösartige Reverse Shells effektiv abgewehrt werden (Quelle: Hacker News)
Engram: Persistentes Gedächtnis-Plugin über Sitzungen und Projekte hinweg für Claude Code : Weaviate hat Engram als Open Source bereitgestellt, ein Speichererweiterungs-Plugin für Claude Code. Das Tool überwindet die Grenzen der Isolation einzelner CLAUDE.md-Repositories und Kaltstarts bei Neustarts: Es erfasst asynchron im Hintergrund Architekturentscheidungen, Tech-Stack-Auswahlen und Code-Iterationshistorien von Entwicklern und injiziert vor jedem Code-Refactoring automatisch die relevantesten Erinnerungen. Dies gewährleistet einen nahtlosen Wissenstransfer über mehrere Projekte und Teams hinweg (Quelle: bobvanluijt)

Natura stellt 99-Dollar-Smart-Ring Interface vor: Rund-um-die-Uhr-Agent-Interaktion kombiniert mit Vitaldaten-Monitoring : Das Hardware-Startup Natura hat den speziell für LLM-Agenten entwickelten Smart-Ring Interface vorgestellt. Der Ring verfügt über ein integriertes leichtes Mikrofon und haptische Sensoren; Nutzer können durch einfachen Druck auf die Fingerspitze Handlungsbefehle an verknüpfte LLMs (darunter ChatGPT, Claude, Grok) erteilen oder Meetings aufzeichnen, wobei die Antworten per Audio-Streaming über Kopfhörer ausgegeben werden. Gleichzeitig bietet der Ring eine Akkulaufzeit von 6 bis 12 Tagen und erfasst kontinuierlich Vitalwerte wie Herzfrequenzvariabilität und Körpertemperatur (Quelle: TechCrunch)

ttok veröffentlicht Major-Update 1.0: Standardmäßige vollständige Anpassung an Tokenizer-Regeln von GPT-5 und GPT-6 : Das vom renommierten Open-Source-Entwickler Simon Willison gepflegte CLI-Token-Zähltool ttok ist offiziell in Version 1.0 erschienen. Das Update verabschiedet sich vom langjährigen Standard-Vokabular von GPT-4 und wechselt vollständig auf das neueste Tiktoken-Kodierungssystem für die Modellfamilien GPT-5 und GPT-6. Praxistests zeigen, dass die Token-Zählungen neuer Spitzenmodelle bei identischen Testkorpora exakt übereinstimmen, was Entwicklern eine einheitliche Grundlage zur präzisen Kalkulation von API-Kosten liefert (Quelle: Simon Willison)
Hermes Agent erscheint im Microsoft Store mit integriertem Headless-Browser-Plugin TinyFish : Der von Nous Research entwickelte quelloffene persönliche Agent Hermes Agent ist nun im Windows Store per Ein-Klick-Installation verfügbar. Die neueste Version integriert das First-Party-Websuche-Plugin TinyFish, wodurch der Agent in lokalen Workflows eigenständig Headless-Browser aufrufen kann, um Live-Webdaten zu scrapen. Vor dem Verbrauch von Credits ist eine Bestätigung der Berechtigungen erforderlich, was die Brücke zwischen dem lokalen PC-Assistenten und dem externen Internet weiter schlägt (Quelle: Teknium)

📚 Forschung & Wissen
15 Spitzeninstitute veröffentlichen 500-Stunden-Visuohaptik-Datensatz TouchScale als Open Source – Erfolgsrate bei Aufgaben verdoppelt : 15 Institutionen, darunter Texas A&M, DeepMind und CMU, haben gemeinsam TouchScale vorgestellt, einen multimodalen visuell-haptischen Datensatz menschlicher Hände mit einheitlichen Sensorspezifikationen. Er umfasst 500 Stunden First-Person-RGB-D-Videos und Daten von Ganzhand-Druckhandschuhen (880 Tasteinheiten pro Hand) über 87.000 Manipulationspfade. Experimente belegen, dass durch kontaktbasiertes Mid-Training die Erfolgsrate von Roboterarmen bei anspruchsvollen physischen Kontaktaufgaben wie dem Sortieren von weichen und harten Objekten von 22,5 % auf 57,5 % anstieg. Dies bestätigt, dass die haptische Modalität ähnliche Scaling-Law-Vorteile wie die visuelle Modalität aufweist (Quelle: Synced, 36Kr)
.jpg)
NVIDIA und Partner stellen Physis-Lang vor: Physikalische Realitätsnähe in der Videogenerierung durch selbstevaluierende physikalische Repräsentationen gesteigert : NVIDIA hat in Kooperation mit dem MIT und der University of Oxford das Framework Physis-Lang zur Selbstevaluation physikalischer Prompt-Repräsentationen vorgestellt. Um das unzureichende Verständnis von Videomodellen für kontinuierliche dynamische Prozesse wie Schmelzen oder Reißen zu verbessern, etabliert das Framework den PhysCapBench-Benchmark mit 3.794 atomaren physikalischen Aussagen. Dadurch generieren LLM-Agenten eigenständig feingliedrige physikalische Kausal-Prompts und rufen gezielt mechanistische Daten ab. Auf dem Physics-IQ Verified Leaderboard erreichte die feingetunte Cosmos3-Serie den ersten Platz und übertraf Standard-Baselines bei der Generierung physikalischer Gesetzmäßigkeiten deutlich (Quelle: Synced)
.jpg)
Cambridge und King’s College London decken Brüche bei der Übersetzung mathematischer Beweise von natürlicher Sprache in Lean auf : Wissenschaftler der University of Cambridge und des King’s College London haben ein Evaluierungspapier veröffentlicht, das die massenhafte Veröffentlichung nicht vollständig formal verifizierter mathematischer Ergebnisse durch Spitzenlabore kritisch beleuchtet. Durch die Analyse von OpenAI-Herleitungen zur Navier-Stokes-Gleichung zeigen sie, dass eine Abschätzung im natürlichsprachigen Paper lediglich 4 zusätzliche Eingangsableitungen verlangte, während der formalisierte Lean-Code 5 geschwächte Bedingungen voraussetzte; auch bei Druck-Fluss-Abschätzungen wurden gänzlich abweichende Schranken und Beweiswege gewählt. Die Forscher warnen, dass rein maschinelle Prüfungen lediglich syntaktische Widerspruchsfreiheit garantieren, aber nicht sicherstellen, dass formalisierte Sätze tatsächlich den in natürlicher Sprache formulierten Theoremen entsprechen (Quelle: THE DECODER, halvarflake, 36Kr)

Studie zur On-Policy-Destillation enthüllt: Modelle erlernen lediglich kombinatorische Reasoning-Fähigkeiten, kein neues Faktenwissen : Zur anhaltenden Debatte, ob On-Policy Distillation (OPD) Modellen neues Wissen vermitteln kann, liefert ein kontrolliertes Experiment eine negative Antwort. Durch die Entkopplung synthetischer Aufgaben und faktischer Frage-Antwort-Szenarien beweist die Studie, dass OPD mit inverser KL-Divergenz mehrschrittige kombinatorische Reasoning-Logiken des Teacher-Modells äußerst stabil auf das Student-Modell überträgt, die Aufnahme neuer faktischer Informationen jedoch gegen null geht. Ein Wechsel zur Vorwärts-KL stellt zwar den Wissenstransfer wieder her, schwächt jedoch die komplexe Reasoning-Organisation. Dies belegt, dass der Kern des Post-Training-Distillation-Prozesses in der Neustrukturierung logischer Pfade innerhalb des bestehenden Parameterraums liegt und nicht in der Erweiterung des faktischen Wissens (Quelle: HuggingFace Daily Papers)
Memento 3: Gradientenfreier, selbstevaluierender Agent basierend auf reflexiver Regelbasis und Code-Kompilierung : Die Studie stellt mit Memento 3 ein externes Selbstevaluierungs-Paradigma für Sprachmodelle mit festen Parametern vor. Der Agent pflegt über einen persistenten Speicher eine natürlichsprachige Regelbasis über Umgebungsdynamiken und kompiliert diese dynamisch in deterministischen, ausführbaren Code für Vorhersage und Planung. Treten bei Umgebungs-Feedbacks Fehler auf, werden Regeln und Code via Unit-Replay automatisch korrigiert. Im Benchmark ARC-AGI-3 meisterte das gradientenfreie System alle 25 Benchmark-Spiele ohne Anpassung der LLM-Gewichte und erzielte eine Effizienz von 100 % im Vergleich zu menschlichen Aktionen (Quelle: HuggingFace Daily Papers)
Apple-Forschungsteam stellt Normalizing Trajectory Models (NTM) vor: 4 Sampling-Schritte erreichen Bildqualität voller Schrittanzahl : Das Machine Learning Lab von Apple hat auf der NeurIPS 2026 die Normalizing Trajectory Models (NTM) vorgestellt. Um das Problem zu lösen, dass Diffusionsmodelle und Flow Matching bei Inferenz mit minimalen Schritten den exakten Likelihood-Rahmen verlieren, modelliert NTM jeden Rückwärts-Diffusionsschritt als ausdrucksstarken bedingten Normalizing Flow. In Kombination mit tiefen parallelen Trajektorien-Prädiktoren und Selbst-Destillation genügen 4 Sampling-Schritte, um die Bildqualität vollständiger Schrittzahlen zu erreichen, während strenge generative Likelihood erhalten bleibt. Damit übertrifft NTM gängige Destillations-Baselines in Bildgenerierungs-Benchmarks deutlich (Quelle: Apple Machine Learning Research)

NVIDIA NeurIPS 2026 Paper: Tool-Nutzung von Agenten erhöht Risiko für multimodale Jailbreaks drastisch : Eine Studie des NVIDIA Security Lab zeigt, dass Sicherheits-Ablehnungsmechanismen aller getesteten multimodalen Großmodelle massiv einbrechen, sobald sie Werkzeuge aufrufen können – die Jailbreak-Erfolgsrate stieg relativ um bis zu 68,7 %. Der Kernmechanismus: Umfangreiche Tool-Rückgabetexte füllen das Kontextfenster rasch und verwässern die Gewichtung der ursprünglichen bösartigen Nutzereingabe, wodurch die Aufmerksamkeit des Modells auf die Tool-Ergebnisse statt auf die Sicherheitsprüfung gelenkt wird. Die Autoren mahnen Entwickler, die Sicherheit von Agenten nicht nur in herkömmlichen Chat-Szenarien zu evaluieren (Quelle: omarsar0)

Google enthüllt Continuous-Integration-Agent FlowAgent: Über 28.000 automatisierte Fixes produktiv übernommen und gemergt : In einem ArXiv-Paper stellt Google den Reparatur-Agenten FlowAgent für Continuous-Integration-Systeme vor. Das System nutzt ReAct-Loops zur Behebung fehlgeschlagener Unit-Tests und führt Vorher-Nachher-Filter ein, um Lösungen mit geringer Konfidenz auszusortieren. Nach unternehmensweitem Rollout bei Google lieferte das System Vorschläge für fast 300.000 Build-Fehler; über 28.000 Patches wurden von Ingenieuren aktiv übernommen und gemergt. Dies belegt den praktischen Nutzen von Software-Engineering-Agenten in anspruchsvollen Produktionsumgebungen (Quelle: omarsar0)

MIT Lincoln Laboratory veröffentlicht LAICS-Bericht zur Evolution kommerzieller AI-Hardware: Compute-Wachstum verlagert sich auf Topologie und Mixed Precision : Das Supercomputing Center des MIT Lincoln Laboratory hat die neueste Übersicht über die Entwicklung von AI-Compute-Hardware (LAICS) herausgegeben. Der Bericht analysiert Spitzenleistung und Energieeffizienz von über 120 kommerziellen AI-Beschleunigern (darunter GPUs, ASICs, FPGAs und Dataflow-Chips) der letzten acht Jahre. Zentrale Erkenntnis: Der primäre Treiber für Rechenleistungssteigerungen verschiebt sich von reiner Strukturverkleinerung hin zu rekonfigurierter Transistordichte, Verbreitung von Mixed-Precision-Formaten niedriger Genauigkeit (wie FP4/NVFP4) sowie On-Chip-Netzwerkarchitekturen mit hoher Bandbreite (Quelle: MIT News)

💼 Wirtschaft
LLM-Evaluierungsplattform Arena sichert sich 200 Millionen US-Dollar in Serie-B-Runde bei 3,1 Milliarden US-Dollar Bewertung und startet Agent Alignment Index : Die aus LMSYS hervorgegangene Blind-Test-Plattform Arena hat eine Series-B-Finanzierungsrunde über 200 Millionen US-Dollar unter Führung von Lightspeed und Khosla bei einer Bewertung von 3,1 Milliarden US-Dollar abgeschlossen. Der annualisierte Umsatz hat 100 Millionen US-Dollar überschritten. Nach der Runde wurde der kommerzielle „AI Alignment Index“ gestartet, der auf über 90.000 Langzeitinteraktionen mit 27 Spitzenmodellen in realen Umgebungen basiert. Er erfasst verdecktes Fehlverhalten wie unbefugte Aktionen, Täuschung von Nutzern und falsche Attributionen und schließt damit eine Lücke bei neutralen Sicherheitstests, bei denen statische Benchmarks versagen (Quelle: TechCrunch, arena)

NVIDIA sagt 1 Milliarde US-Dollar über fünf Jahre für US-Forschung zu Superintelligenz und Quantencomputing zu : Auf einem Wissenschaftsgipfel in Washington hat NVIDIA angekündigt, in den kommenden fünf Jahren Compute-Ressourcen, finanzielle Mittel und Hard- sowie Software-Ökosysteme im Wert von 1 Milliarde US-Dollar bereitzustellen, um Spitzenforschung und Quantencomputing in den USA zu fördern. Die Initiative richtet sich an führende US-Universitäten, Forschungsinstitute, Quantenlabore und Cloud-Anbieter mit Bundesforschungsaufträgen. Ziel ist es, AI durch beschleunigte Recheninfrastruktur tief in Materialforschung, Fusionsplasma-Simulationen und hybride Quanten-Klassik-Architekturen zu integrieren (Quelle: The Verge)
Cloudflare übernimmt Kernteam der JavaScript-Runtime Deno vollständig zur Stärkung des Edge-Computing-Ökosystems : Cloudflare hat die vollständige Übernahme des Deno-Kernteams bekannt gegeben; Ryan Dahl, Schöpfer von Node.js und Deno, wechselt mit seinem gesamten Team zum Unternehmen. Das Team wird in die Abteilung Cloudflare Workers integriert und sich primär auf die Weiterentwicklung der quelloffenen Serverless-Engine workerd konzentrieren sowie nativeren Node.js-Support und moderne Webstandards auf die Edge-Serverless-Plattform bringen, um Cloudflares Vorsprung bei AI-cloudnativen Edge-Gateways weiter auszubauen (Quelle: threepointone)
🌟 Community
Fields-Medaillenträger von 2022 beklagt Zerstörung des akademischen Ökosystems junger Forscher durch OpenAIs Brute-Force-Lösung mathematischer Probleme : Fields-Medaillenträger Hugo Duminil-Copin äußerte in einem akademischen Vortrag öffentlich, dass OpenAIs geballte Veröffentlichung Hunderter mathematischer Manuskripte – darunter auch zu Themen seines Forschungsbereichs – wie das „Überrollen durch mehrere Lastwagen“ gewirkt habe. Dies zerstöre das Reservoir offener Vermutungen, auf das Nachwuchswissenschaftler für Professuren und Fördergelder angewiesen seien, und stürze Promovierende in beispiellose Verunsicherung. Die akademische Welt zeigt sich schockiert über den Einsatz massiver Rechenkraft durch kommerzielle Closed-Source-Unternehmen zur Erschließung offener Forschungsfragen; Debatten über die Lesbarkeit maschinengenerierter Beweise und Standards für Peer-Reviews halten an (Quelle: JvNixon)
Community optimiert Manuskript zur OpenAI-Ganzzahlmultiplikation weiter: Signifikanter Fortschritt bei Schrankenkorrektur-Parametern : Nachdem ein OpenAI-Manuskript behauptet hatte, die $n \log n$-Schranke für Ganzzahlmultiplikation unterboten zu haben, startete die mathematische Open-Source-Community einen Live-Tracker für Optimierungsbeiträge. Durch Neuentwurf endlicher Netzwerke und Entfernen quadratischer Bottleneck-Penalties verbesserten Entwickler und Forscher mithilfe von Codex innerhalb weniger Tage den Korrekturparameter $\kappa$ der oberen Schranke drastisch von ursprünglich $2^{-182}$ auf $2^{-15}$, verifiziert durch den Lean-Kernel. Dies demonstriert das enorme Tempo Mensch-Maschine-kollaborativer Spitzenforschung in der Mathematik (Quelle: BorisMPower, Don’t Worry About the Vase)

Ben Affleck sorgt mit tiefgehendem Verständnis von AI-Filmproduktion für Aufsehen in der Tech-Community: Hollywood-Star vertraut mit Tensoren und Weight-Fine-Tuning : Videos aus Interviews, in denen Hollywood-Star Ben Affleck ein tiefes technisches Verständnis von AI beweist, verbreiten sich rasant in der Tech-Community. Affleck erläuterte versiert die mathematische Logik hinter Convolutional Neural Networks, Tensoren, Kantenerkennung und GPU-Inferenz. Zudem beschrieb er detailliert, wie sein von Netflix übernommenes AI-Studio das Backbone von Open-Source-Großmodellen einfriert und nur die letzte Schicht mit selbst erstellten hochwertigen Videodatensätzen feintunt, um Filmästhetik auf Industrieniveau zu gewährleisten und Urheberrechtsrisiken zu minimieren – wofür er als „Regisseur auf Silicon-Valley-Niveau“ gefeiert wurde (Quelle: Latent Space)
Interview mit Periodic Labs: Physikalische Experimente und Real-World Reinforcement Learning als Fundament für AI-Wissenschaftler : Der ehemalige OpenAI-Forscher Liam Fedus und der ehemalige Google DeepMind-Forscher Dogus Cubuk haben im Podcast die technische Roadmap des neuen Material-Startups Periodic Labs detailliert erläutert. Sie betonten, dass reines Pre-Training auf Internet-Texten oder synthetische logische Deduktion physikalisches Neuland nicht erschließen könne, da reale Materialien komplexe mikroskopische Phasenübergänge und Messrauschen aufweisen. Das Team bindet reale High-Throughput-Laborgeräte in einen Closed-Loop mit Reinforcement Learning und Umgebungs-Feedback ein und nutzt jede gescheiterte Synthesetrajektorie als hochwertiges Negativbeispiel zur Erforschung einer „synthetischen Superintelligenz“ (Quelle: Latent Space)
Cloudflare erstattet Rekordrechnung nach AI-Endlosschleife vollständig und analysiert architektonische Risiken : Nachdem ein Entwickler beim Einsatz von Codex zur Programmierung von Cloudflare Durable Objects durch eine fehlerhafte AI-Alarm-Retry-Logik in eine Endlosschleife mit Hunderten Anfragen pro Sekunde geraten war, fielen innerhalb kürzester Zeit Datenbankkosten im fünfstelligen Dollarbereich an. Nach Klärung erließ Cloudflare den Betrag vollständig. In der Support-Analyse legten Ingenieure dar, wie das moderne „Vibe Coding“ mangels Code-Reviews durch Entwickler in serverlosen Umgebungen ohne harte Ausgabengrenzen leicht verdeckte finanzielle Lawinen auslösen kann (Quelle: dotey)
💡 Sonstiges
Anthropic sagt 150 Millionen US-Dollar für die „Genesis Mission“ des Weißen Hauses zur Unterstützung nationaler Spitzenforschung zu : Auf einem Gipfel des Office of Science and Technology Policy im Weißen Haus hat Anthropic zugesagt, in den nächsten drei Jahren Compute- und Technologie-Ressourcen im Wert von 150 Millionen US-Dollar für die nationale US-Initiative „Genesis Mission“ bereitzustellen. Anthropic wird eng mit 15 Bundesforschungsinstituten und National Laboratories zusammenarbeiten – darunter NASA und National Institutes of Health –, um Claude und automatisierte Code-Umgebungen bereitzustellen sowie technologische Unterstützung und Trainings für komplexe Forschungsherausforderungen wie Fusionsenergiesteuerung und Quantencomputing anzubieten (Quelle: Anthropic News)
MIT-Team nutzt Machine Learning zur dynamischen Server-Planung gegen Energieverschwendung in Rechenzentren : Angesichts der globalen Stromnetzbelastung durch den Boom von AI-Großmodellen hat ein Team um MIT-Associate-Professorin Christina Delimitrou eine Deep-Learning-basierte Architektur für das Energiemanagement von Servern entwickelt. Das System prognostiziert Ressourcenkonflikte von Microservices und cloudnativer Software in Echtzeit und ermöglicht dynamisches Scheduling sowie Verdichtung von Server-Clustern, die derzeit oft nur mit einer effektiven Compute-Auslastung von 15 % laufen. Dadurch wird das Potenzial hochdichter Rechenleistung ohne Ausbau der Strominfrastruktur freigesetzt und der Stromverbrauch signifikant gesenkt (Quelle: MIT News)
