🔥 Im Fokus
OpenAI veröffentlicht 722 Manuskripte unveröffentlichter mathematischer Modelle und rüttelt an Jahrhundertproblemen wie der Quasi-Riemannschen Vermutung : OpenAI hat im GitHub-Open-Source-Repository openai/math offiziell 372 Ergebnis-Sets mit insgesamt 722 mathematischen Manuskripten veröffentlicht, die von einem unveröffentlichten internen Frontier-Modell generiert wurden. Die Kernergebnisse umfassen die Quasi-Riemannsche Vermutung (mit dem Anspruch, zu beweisen, dass alle Dirichlet-L-Funktionen im Realteil größer als 7/8 keine Nullstellen besitzen und Siegel-Nullstellen eliminiert werden), Beweise zur Hodge-Vermutung für abelsche Varietäten, die vierdimensionale Kakeya-Vermutung, Hilberts zehntes Problem über den rationalen Zahlen sowie die Etablierung der regulären NP-Härte-Schwelle für Basic-SDP abseits der Unique Games Conjecture; rund 160 Arbeiten enthalten formale Beweise in Lean. OpenAI gab an, dass ein einzelnes Ergebnis im Schnitt etwa 3 Stunden ChatGPT Pro Inferenz-Rechenleistung in Anspruch nahm. Obwohl dies als Meilenstein maschineller wissenschaftlicher Entdeckungen gewertet wird, betonte ein Beratergremium des Institute for Advanced Study in Princeton (darunter drei Fields-Medaillenträger) in einer Stellungnahme, dass eine Veröffentlichung nicht gleichbedeutend mit akademischer Anerkennung sei, und warnte davor, dass die massenhafte maschinelle Generierung von Beweisen die Verarbeitungs- und Verifikationskapazitäten menschlicher Wissenschaftler ernsthaft überfordert (Quelle: 机器之心、The Verge、Latent Space、Abhishek Saha、openai)

US-Energieministerium und NIH starten gemeinsam mit DeepMind und weiteren Tech-Giganten die „Virtual Biology Initiative“ : Das US-Energieministerium (DOE) und die National Institutes of Health (NIH) haben eine strategische Partnerschaft auf nationaler Ebene angekündigt und gemeinsam mit Google DeepMind, Meta, Isomorphic Labs und Nvidia die „Virtual Biology Initiative“ ins Leben gerufen. Das Programm zielt darauf ab, zellbiologische Prozesse systematisch über alle Skalen hinweg zu kartieren und standardisierte Benchmark-Daten zu generieren. Durch die Bündelung multimodaler AI soll das weltweit erste universelle digitale Modell entstehen, das zelluläre Lebensprozesse End-to-End vorhersagen kann, um die Wirkstoffforschung sowie das Verständnis von Krankheitsmechanismen aus ersten Prinzipien neu zu definieren (Quelle: Alex Rives)
Google DeepMind veröffentlicht On-Device-Omni-Modell EmbeddingGemma 2 als Open Source : Google DeepMind hat offiziell sein erstes multimodales Embedding-Modell auf Basis der Gemma 4-Architektur, EmbeddingGemma 2, unter der Apache 2.0-Lizenz als Open Source bereitgestellt. Mit 740M Parametern vereinheitlicht das Modell nativ die Vektorrepräsentationsräume für Text, Code, Bilder, Audio und Video und unterstützt ein Context Window von 8K. Sein modularer Aufbau erlaubt es, den reinen Textmodus mit lediglich 270M Parametern auszuführen; quantisiert benötigt es auf Mobilgeräten nur etwa 191 MB Speicher. Dank Matryoshka Representation Learning können Dimensionen dynamisch auf unter 768 Dimensionen gekürzt werden. Qdrant-Tests zeigten, dass in Kombination mit 1-Bit-Quantisierung der VRAM-Bedarf um das 77-Fache sinkt, während 94,5 % der Retrieval-Genauigkeit erhalten bleiben – eine Schließung der Infrastrukturlücke für leichtgewichtiges On-Device Multimodal RAG und semantische Offline-Suche (Quelle: Google DeepMind Blog、THE DECODER、GoogleDeepMind)

OpenAI liefert Tag-2-Update der „28-Tage-Challenge“: Auto-review vollständig kostenlos und Decisions API in öffentlicher Beta : Am zweiten Tag der Challenge „28 Tage täglicher praktischer Verbesserungen“ stellte OpenAI zentrale Updates zur Reduzierung von Reibungsverlusten beim Agent-Deployment vor: Das Feature Auto-review für automatisierte Risiko- und Sicherheitsaudits bei Langzeitaufgaben steht nun allen eingeloggten ChatGPT-Nutzern kostenlos und ohne Anrechnung auf das Kontingent zur Verfügung. Die API-Preisebenen wurden von fünf auf drei Stufen (Build, Launch, Grow) vereinfacht, wobei die Schwelle für die höchste Stufe auf 500 US-Dollar gesenkt wurde. Die Decisions API für diskretes Routing und Tool-Dispatching ging in die öffentliche Beta; angetrieben von GPT-6 Luna bietet sie serverseitige Latenzen unter 100 ms für nur 0,10 US-Dollar pro Million Input-Token, ohne zusätzliche Kosten für Output oder Caching. Zudem startete auf macOS der schrittweise Rollout eines Plugins für den Meetings-Arbeitsbereich (Quelle: 机器之心、OpenAI Developers、)

Meta und Sierra veröffentlichen mit Branchengrößen das Personal Agent Protocol (PAP) zur Standardisierung von Mensch-Unternehmen-Agent-Interaktionen : Um das Problem zu lösen, dass Consumer AI Agents auf kommerziellen Websites regelmäßig von Anti-Scraping-Filtern blockiert werden, haben Meta und die KI-Kundenservice-Plattform Sierra gemeinsam mit Stripe, Shopify, Walmart und weiteren Unternehmen den offenen Branchenstandard „Personal Agent Protocol“ (PAP) initiiert. Das auf A2A- und OAuth-Architekturen basierende Protokoll definiert klare Authentifizierungs- und Risikokontrollgrenzen für die Kommunikation zwischen persönlichen AI-Assistenten und Unternehmenssystemen, wenn diese im Auftrag von Nutzern E-Commerce-Bestellungen tätigen, Tickets buchen oder Formulare ausfüllen. Parallel stellte Decagon das begleitende PACT-Vertrauensprotokoll als Open Source vor, um Reibungsverluste bei grenzüberschreitenden Agent-Aufrufen zu minimieren (Quelle: The Verge、TechCrunch、saranormous)

🎯 Entwicklungen
Google DeepMind veröffentlicht Bildgenerierungs- und -editierungsmodell Nano Banana 2.1 : Google hat das generative Bildmodell Nano Banana 2.1 auf Basis von Gemini 3.6 Flash veröffentlicht (API-Bezeichnung gemini-nano-banana-2.1), verfügbar in der Gemini API, in AI Studio und Google Ads. Das neue Modell unterstützt nativ komplexe Typografie-Designs, präzises Mask-Inpainting sowie die konsistente Fusion von bis zu 14 Referenzbildern für Charaktere bei Renderauflösungen von bis zu 4K. Die Generierungskosten pro Bild sanken um etwa 50 % auf 0,034 US-Dollar, mit Schwerpunkt auf der Lösung von Multi-Turn-Konsistenzproblemen im kommerziellen visuellen Design (Quelle: 机器之心、GoogleAIStudio、THE DECODER)

Claude löst Problem der Wahrscheinlichkeitstheorie: Lean-formalisierter Beweis für die Vermutung kontinuierlicher Phasenübergänge bei Perkolation : Ein unangekündigtes internes Frontier-Modell von Claudes Entwickler Anthropic hat die Mathematiker seit fast 70 Jahren beschäftigende Vermutung über kontinuierliche Phasenübergänge (unendliche Verbindungswahrscheinlichkeit bei der kritischen Wahrscheinlichkeit $p_c$ beträgt 0) gelöst. Aufbauend auf dem im Jahr 2024 etablierten Ungleichungs-Framework lieferte das Modell mithilfe des Lean-Beweisassistenten tausende Zeilen formaler Herleitungen. Damit durchbrach es den langjährigen Stillstand in den kritischen physikalischen Dimensionen 3 bis 10. Dass eine AI den formalen Beweis einer Vermutung auf Fields-Medaillen-Niveau erbracht hat, sorgt in der akademischen Welt für tiefes Aufsehen (Quelle: 36氪)

Anthropic erweitert Cyber Verification Program und führt dreistufiges Zugangsmodell ein : Anthropic hat angekündigt, sein Cyber Verification Program (CVP) in ein reguläres dreistufiges Zugangsmodell (Defensiv, Red Team, Dediziert) zu überführen. Verifizierte Organisationen und White-Hat-Experten erhalten damit Zugriff auf Versionen von Claude Opus 5.5, Sonnet 5.5 und Mythos 5.1 mit gelockerten Sicherheitsfiltern. Das neue System erlaubt erstmals den konformen Einsatz autorisierter offensiver Fähigkeiten für Penetrationstests und Red-Teaming, um den Konflikt zu lösen, dass Verteidiger leistungsstarke Tools zum Patchen von Schwachstellen benötigen, diese aber durch allgemeine Sicherheitsrichtlinien blockiert wurden (Quelle: Anthropic News、AnthropicAI、THE DECODER)
DeepMind stellt AlphaGenome Atlas vor, um Auswirkungen genomweiter Varianten zu entschlüsseln : Google DeepMind hat das genomische Deep-Learning-Modell AlphaGenome und dessen vorberechnete Datenbank AlphaGenome Atlas vorgestellt. Das Modell bietet eine Auflösung auf Einzelbasenpaarebene und ein Kontextfenster von 1 Million Basenpaaren. Der zugehörige Atlas enthält vorberechnete molekulare Phänotyp-Auswirkungen aller 9 Milliarden potenziellen Einzelnukleotid-Varianten im menschlichen Genom – ein Datenumfang, der das 30-Fache der AlphaFold-Datenbank erreicht und die systematische Erforschung seltener Mutationen sowie Krankheitsanfälligkeiten vorantreiben soll (Quelle: )
vLLM v0.31.0 führt CRIU-Snapshot-Mechanismus ein und verkürzt Kaltstarts auf Prozesswiederherstellung im Millisekundenbereich : vLLM hat Version v0.31.0 veröffentlicht und integriert vllm snapshot sowie den Hintergrund-Daemon vllm preload. Auf Basis der Linux CRIU-Technologie ermöglicht dieser Mechanismus blitzschnelles Checkpoint-Speichern und Image-Wiederherstellen zur Laufzeit der Inferenz-Engine. Bei Instanz-Failovern oder Skalierungen entfällt das zeitaufwändige Laden von Modellgewichten und Initialisierungen, wodurch Kaltstart-Latenzen beim elastischen Scheduling großer Inferenz-Cluster drastisch reduziert werden (Quelle: vLLM)
HIT und NUS veröffentlichen QuantWM als Open Source: 2-Bit KV Cache-Komprimierung für Video-Weltmodelle : Um den extremen VRAM-Verbrauch autoregressiver Video-Weltmodelle und das durch herkömmliche Quantisierung verursachte Bildflackern zu beheben, hat ein Team des Harbin Institute of Technology (Shenzhen) und der National University of Singapore die trainingsfreie Quantisierungsmethode QuantWM vorgestellt. Die Studie zeigt, dass räumlich-zeitliche Attention-Fehlstellungen durch quantisierte Keys die Ursache für zeitliches Ruckeln sind. Durch sensitivitätsbewusstes Clustering und Fehlerkompensation im Hauptunterraum erreicht QuantWM eine bis zu 6,2-fache KV Cache-VRAM-Kompression bei gleichzeitig zeitlich stabilen Videosequenzen (Quelle: 机器之心)
.jpg)
Perplexity veröffentlicht aktualisiertes Open-Source-Entscheidungsmodell pplx-decider-v1.1-27b : Perplexity hat das verbesserte multimodale Entscheidungsmodell pplx-decider-v1.1-27b als Open Source herausgebracht. Die Gewichte belegten im neuesten Hugging Face Decision Index 0.3 den ersten Platz. Bei unverändert hoher Präzision visueller und logischer Entscheidungen wurde die Inferenzeffizienz deutlich optimiert, während der Preis für die zugehörige Decision API auf 0,02 US-Dollar pro Million Input-Token gesenkt wurde (Quelle: AravSrinivas)

Meta veröffentlicht produktionserprobten Assignment-Solver Rebalancer als Open Source : Meta hat seinen intern seit über 9 Jahren eingesetzten C++ Core-Solver Rebalancer (mit Python-Schnittstelle und unter Apache 2.0-Lizenz) offiziell als Open Source bereitgestellt, der täglich rund 40 Millionen Ressourcen-Scheduling-Vorgänge bewältigt. Das Tool abstrahiert NP-schwere Probleme wie Shard-Scheduling und Traffic-Balancing in gerichtete azyklische Graphen (DAGs) und bietet effiziente lokale Suche sowie gemischt-ganzzahlige Optimierung (MIP) für extrem große Systeme mit Millionen von Entitäten (Quelle: MarkTechPost)
TII veröffentlicht Falcon-Emirati-7B: Großes Sprachmodell für emiratische Dialekte : Das Technology Innovation Institute (TII) der VAE hat Falcon-Emirati-7B vorgestellt, ein speziell auf emiratische Dialekte ausgerichtetes Modell. Das Team entwickelte eine Daten-Pipeline mit webbasierten Umgangssprachen, lokalem Kulturkontext und kontrollierten synthetischen Korpora. Auf dem lokalen Benchmark Alyah erzielte das Modell eine Genauigkeit von 84,83 % bei Multiple-Choice-Aufgaben und verbesserte im freien Dialog das Verständnis kultureller Metaphern und gesellschaftlicher Konventionen spürbar (Quelle: HuggingFace Blog)

Figma AI Agent für Produktdesign erreicht allgemeine Verfügbarkeit (GA) : Figma hat angekündigt, dass sein integrierter AI Agent für UI/UX-Produktdesign nun allgemein für alle Nutzer verfügbar ist. Das Update führt eine Anbindung an Design-System-Richtlinien für Teams sowie Funktionen zur kollaborativen Visualisierung von Agent-Aktionen in Multiplayer-Umgebungen ein. Damit können Agenten direkt auf Basis bestehender Komponentenbibliotheken High-Fidelity-Interfaces und interaktive Prototypen mit mehreren Zuständen automatisiert erstellen (Quelle: The Verge)

Cohere veröffentlicht Tiny Aya als Open Source: Familie kleiner mehrsprachiger Modelle für über 70 Nischensprachen : Cohere Labs hat auf der COLM 2026 die leichtgewichtige multilinguale Modellfamilie Tiny Aya als Open Source vorgestellt. Die Serie kombiniert universelle mehrsprachige Basismodelle mit regional spezialisierten Varianten und deckt über 70 Sprachen weltweit ab (darunter viele ressourcenarme Sprachen). Ziel ist es, die Hürden für On-Device-Einsätze zu senken und die interkulturelle semantische Generierung kleiner Modelle zu verbessern (Quelle: sarahookr)

NeurIPS 2026 | SAGE-Framework nutzt topologische Struktursignale zur Korrektur langer LLM-Schlussfolgerungsketten : Gegen das Problem, dass LLMs bei langen Schlussfolgerungsketten vom Weg abkommen und mangels zeitnaher Zwischenbewertungen nicht korrigiert werden können, hat ein Team der Virginia Tech und Partner die Methode SAGE (Structure Admissibility-Guided Exploration) vorgestellt. Der Ansatz komprimiert Explorationsabweichungen durch algebraische Sparsifizierung und liefert schrittweises Feedback über hyperbolische Raumdistanzen. Dadurch stieg die Genauigkeit bei symbolischen und formalen Mathematik-Benchmarks signifikant, und die Verifikationsrate in Lean vervielfachte sich (Quelle: 机器之心)
.jpg)
Google startet experimentelle No-Code-Spieleplattform Playground : Google hat die experimentelle AI-Spieleplattform playground.google gestartet. Nutzer können dort rein über natürlichsprachliche Prompts im Browser leichtgewichtige Spiele mit individuellen Physikregeln, Charakterinteraktionen und Szeneriestilen erstellen, plattformübergreifend spielen und in der Community teilen. Für die Zukunft ist eine Integration mit Unity Spark geplant, um professionellere 3D-Engine-Unterstützung zu bieten (Quelle: Google AI Blog)
Replit führt projektübergreifenden globalen Kontext und asynchrone Hintergrund-Code-Agents ein : Replit hat seine Entwicklungsumgebung umfassend aufgerüstet und einen projektübergreifenden globalen Workspace-Kontext eingeführt. Agenten können nun sämtliche historische Projekte und Designrichtlinien eines Benutzerkontos indizieren, um Farbpaletten und Komponentenlogiken aus Referenzprojekten in neue Vorhaben zu übertragen. Zudem werden asynchrone Generierungs- und Bearbeitungsaufgaben im Hintergrund mit 1-Klick-Review und Merge unterstützt (Quelle: amasad)
🧰 Tools
Hark Pro: On-Device-fokussierter privater persönlicher Agent mit isoliertem Sandbox-Browser : Das Team um Figure AI-Gründer Brett Adcock hat die Desktop- und Mobilanwendung Hark Pro veröffentlicht. Ausgestattet mit dem Handoff Computer-Use-Agenten und einem von ehemaligen Apple-Designern entwickelten Interface kann das System Benutzerdaten sicher in einer isolierten Sandbox verwalten, eigenständig Webseiten navigieren und Aufgaben wie Visumanträge, Ticketkäufe oder formularbasierte Workflows ausführen. Alle Aktionen werden dem Nutzer transparent angezeigt, um autonome Handlungen mit lokaler Privatsphäre zu verbinden (Quelle: TechCrunch、TheRundownAI)
Monid.ai sichert sich 7,7 Millionen US-Dollar für dynamisches Tool-Abrechnungsgateway für AI Agents : Der Agent-Infrastrukturanbieter Monid.ai hat 7,7 Millionen US-Dollar eingesammelt und ein Aggregator-API-Gateway vorgestellt, das als „OpenRouter für AI Agents“ bezeichnet wird. Über eine einzige Schnittstelle können Agenten zur Laufzeit dynamisch über 2.500 kommerzielle APIs aus den Bereichen Marketing, SEO, Websuche, E-Commerce und multimodale Generierung entdecken und per Pay-per-Call abrechnen, anstatt an starre monatliche SaaS-Abonnements gebunden zu sein (Quelle: yoheinakajima)
AgentID gestartet: Dedizierte Identitäts- und Anmeldelösung für AI Agents : AgentMail hat den Dienst AgentID eingeführt. Jeder autonom agierende Agent erhält eine verifizierte E-Mail-Adresse und Identitätsdaten, die an den menschlichen Eigentümer gekoppelt sind. Dies erlaubt es Drittanbieter-SaaS-Plattformen, externe Agenten sicher für Logins und plattformübergreifende Autorisierungen zuzulassen, während Audit-Nachverfolgbarkeit gewahrt bleibt und Kontosperren durch Risikofilter vermieden werden (Quelle: omarsar0)
Spotify Portal AI Plugins: Enterprise-Entwicklungsplattform in führende Code-Agents integriert : Spotify hat eine offizielle Open-Source-Plugin-Suite veröffentlicht, die seine interne Entwicklerplattform Spotify Portal direkt an Claude Code, Codex und Cursor anbindet. Agenten können damit über die Befehlszeile (CLI) Microservice-Kataloge durchsuchen, Diagnosen ausführen und Systemstatus abfragen. Zudem ermöglicht ein Shunt-Plugin die Auslagerung I/O-intensiver Aufgaben an leichtere Modelle zur Reduzierung von Token-Kosten (Quelle: GitHub Trending)
T3 Code führt interaktive UI-Echtzeit-Renderings und -Vorschauen direkt im Chat-Thread ein : Das Coding-Tool T3 Code bietet nun eine integrierte UI-Visualisierung. Bei Frontend-Refactorings oder PR-Code-Reviews kann der Agent interaktive HTML/React-Komponenten und visuelle Prototypen direkt im Konversationsverlauf inline rendern, was Entwicklern das häufige Wechseln zur IDE für Hot-Reload-Debugging erspart (Quelle: theo)

Overmind als Open Source veröffentlicht: Automatisierte Destillation spezialisierter Kleinmodelle aus Agent-Ausführungsspuren : Das Open-Source-Tool Overmind extrahiert aus Tool-Aufruf-Logs und Ausführungsverläufen von Coding- oder Business-Agents hochwertige Datensätze für Fine-Tuning und Evaluation. In Praxistests senkte ein so feinabgestimmtes vertikales Kleinmodell bei der Klausel-Extraktion aus langen Verträgen die Zitations-Halluzinationsrate von 3,36 % (bei großen Modellen) auf 0,12 % (Quelle: kimmonismus)

Mitchell Hashimoto veröffentlicht universelle Terminal-Status-Spezifikation OSC 7501 : Der renommierte Entwickler Mitchell Hashimoto hat die Spezifikation OSC 7501 vorgestellt, mit der Kommandozeilenprogramme ihren Status – wie Leerlauf, Aktiv, Blockiert/Wartend, Erfolgreich oder Fehlgeschlagen – präzise an das Terminal melden können. Dies soll heuristische Regex-Prüfungen ersetzen, auf die hunderte Agent-Orchestrierungstools derzeit angewiesen sind, und ein standardisiertes Statusprotokoll für Multi-Agent-Systeme etablieren (Quelle: mitchellh)
Scale AI veröffentlicht High-Fidelity-RL-Umgebungs-Framework AgentEnv als Open Source : Scale AI hat gemeinsam mit Modal das Framework AgentEnv vorgestellt. Die Suite wurde speziell für das Reinforcement Learning-Post-Training komplexer Langzeit-Agents entwickelt und bietet dynamische Trigger, virtuelle Uhren und Multi-Sandbox-Orchestrierung. Sie lässt sich nahtlos an gängige Cloud-Sandbox-Cluster anbinden, um massive parallele Rollouts und adversarielles Training in dynamischen Umgebungen zu ermöglichen (Quelle: Scale AI)
DAIR.AI stellt MCP-Suite zur Recherche von Top-Konferenz-Papern für AI Agents vor : Die KI-Organisation DAIR.AI hat ein spezielles MCP-Plugin herausgebracht, das die direkte Einbindung in Claude Code, Codex und Grok Bot ermöglicht. Agenten können eigenständig auf kuratierte KI-Forschungsdatenbanken zugreifen, den Stand der Forschung zusammenfassen, Literaturübersichten verfassen und Methodenarchitekturen visuell vergleichen (Quelle: DAIR.AI)
ruNNtime bringt EmbeddingGemma 2 vollständig via WebGPU in den Browser : Die WebGPU-Inferenzbibliothek ruNNtime hat die Text- und Vision-Tower von EmbeddingGemma 2 erfolgreich in eine reine Frontend-Umgebung portiert. Nutzer können nun ohne Backend-Server multimodale semantische Suchen direkt auf lokalen GPUs im Browser durchführen – ein Beweis für das Potenzial leichtgewichtiger On-Device-Architekturen für datenschutzfreundliche und netzunabhängige Einsätze (Quelle: Reddit r/LocalLLaMA)

Anthropic startet öffentliche Beta des Add-ons Claude for Google Workspace : Anthropic hat ein offizielles Google Workspace-Seitenleisten-Add-on für zahlende Abonnenten gestartet. Nutzer können Claude damit direkt in Docs, Slides und Sheets für mehrstufiges Editieren, strukturelle Optimierung und automatisches Formatieren einsetzen, inklusive direktem Zugriff auf dokumentenübergreifenden Kontext (Quelle: The Verge)
📚 Forschung & Wissen
Team um Yann LeCun stellt hierarchisches Weltmodell H-JEPA vor: Erfolgsrate bei visueller Langzeitplanung vervierfacht : Um dem Problem zu begegnen, dass End-to-End-Vision-Planung häufig lokale Details verliert, hat das Team um Yann LeCun die hierarchische Repräsentationsarchitektur H-JEPA vorgestellt. Jede Ebene besitzt eigene latente Räume und semantische Abstraktionsskalen. Im anspruchsvollen Visual AntMaze-Test zur Langzeitplanung steigerte die dreistufige Architektur die Erfolgsrate von 18 % auf 73 % (Quelle: ylecun)

Meta und MIT präsentieren Coco: Multi-Agent-Plattform für Co-Design von Hardware und Deep-Learning-Modellen : Meta und das MIT haben das Multi-Agent-System Coco für das Hardware-Design vorgestellt. Bei Hunderten Gigabytes ungesehener Simulationsdaten können Agenten eigenständig SQL-Abfragen an relationale Datenbanken stellen, Analysetools orchestrieren und UI-Navigationszustände erfassen. Dadurch halbiert sich der Arbeitsaufwand von TPU-Architekten beim Aufbau von Simulationskonfigurationen und der Ursachenanalyse von Leistungsengpässen (Quelle: dair_ai)

Leitfaden zum Aufbau intelligenter Assistenten mit Langzeitgedächtnis auf Basis von AgentCore und OpenClaw : Das AWS-Team hat einen umfassenden Architektur-Leitfaden veröffentlicht, der zeigt, wie sich eine OpenClaw-Basis mit Bedrock AgentCore-Komponenten für persistentes Gedächtnis auf Serverless-Runtimes kombinieren lässt. Der Artikel analysiert eine zweistufige Speicherarchitektur aus kurzfristiger Ereigniserfassung und asynchroner langfristiger Faktenextraktion, während Prompt Caching die Inferenzkosten bei Multi-Turn-Interaktionen um fast 90 % senkt (Quelle: AWS Machine Learning Blog)

Stanford stellt Priced Guidance-Framework vor: Quantifizierung der Fähigkeit von LLMs zur Formulierung originärer wissenschaftlicher Hypothesen : Das Team um Percy Liang hat ein informationstheoretisches Evaluationsparadigma namens Priced Guidance eingeführt. Über einen „20-Fragen“-Spielmechanismus misst das System präzise die benötigten Informationsbits, die ein Modell benötigt, um Kernkonzepte künftiger wissenschaftlicher Publikationen ausgehend von seinem Pre-Training-Cutoff zu rekonstruieren. Dies etabliert einen Benchmark zur Quantifizierung wissenschaftlicher Intuition und Frontier-Generalisierung aus Kompressionsperspektive (Quelle: percyliang)

Multi-Teacher On-Policy Distillation (MOPD): Beseitigung domänenübergreifender RL-Konflikte : Eine neue Forschungsarbeit analysiert die Methode Multi-Teacher On-Policy Distillation (MOPD). Um Reward-Konflikte und Rechenüberlastungen zu überwinden, die entstehen, wenn mehrere Domänen wie Reasoning, Coding und Dialog im einheitlichen RL-Fine-Tuning kombiniert werden, trainiert der Ansatz separate fachspezifische Lehrermodelle. Anschließend wird das Schülermodell über inverse KL-Divergenz auf Token-Ebene dicht überwacht, was ein allumfassendes Modell bei hoher Stichprobeneffizienz ermöglicht (Quelle: cwolferesearch)

HAD-Framework: Steigerung der Handlungsfähigkeit kleiner Sprachmodell-Agents durch umgebungsbewusste Destillation : Ein neues Paper stellt die Destillationsmethode HAD für kleine Modelle in Harness-Umgebungen vor. Durch den Vergleich der Aktionen von Lehrermodellen mit und ohne externe Statusinformationen lernt das kleinere Modell gezielt die Nutzung von Framework-Informationen. Auf dem ALFWorld-Benchmark stieg die Erfolgsrate kleiner Modelle auf 63,4 %, wobei sich die Agents in fast 60 % der bisherigen Deadlock-Szenarien erfolgreich befreien konnten (Quelle: omarsar0)

Amazon AGI veröffentlicht adaptives rekurrentes Diffusions-Sprachmodell ALoDLM als Open Source : Das Amazon AGI-Forschungsteam hat die Architektur und Trainingsmethode des 8B-Parameter-Modells ALoDLM als Open Source bereitgestellt. Durch adaptive rekurrente Inferenz und schrittweise Fehlerkorrektur innerhalb des Diffusions-Sprachmodells werden Rechenressourcen für schwierige Samples dynamisch skaliert. Bei mehreren umfassenden Sprachverständnis- und Generierungs-Benchmarks übertraf das Modell gleich große autoregressive Baselines deutlich (Quelle: arankomatsuzaki)

Jay Alammar teilt Kern-Systemarchitektur aus dem „Illustrated Guide to AI Agents“ : Der bekannte Fachautor Jay Alammar hat das zentrale Regelkreis-Architekturdiagramm für Agentensysteme veröffentlicht. Es veranschaulicht detailliert den rekursiven Ablauf von LLMs in Agent-Umgebungen – von der Aufnahme von Nutzerzielen über Zustandsverwaltung und Speicherabruf bis hin zur Ausführung von Aktionen in der Umgebung – und fasst fundamentale technische Bausteine moderner autonomer Agenten zusammen (Quelle: Jay Alammar)

💼 Wirtschaft
AMD kündigt geplante Übernahme von Fei-Fei Lis Spatial-Intelligence-Startup World Labs für 8,2 Milliarden US-Dollar in Aktien an : AMD hat eine endgültige Vereinbarung zur Übernahme des von Fei-Fei Li mitgegründeten Weltmodell-Unicorns World Labs im Rahmen einer reinen Aktientransaktion im Wert von rund 8,2 Milliarden US-Dollar bekannt gegeben. Branchenbeobachter werten dies als industriellen Wendepunkt für Embodied AI und Weltmodelle, nachdem das Atlas-Modell die Machbarkeit von 4D-Echtzeitrekonstruktionen aus spärlichen Blickwinkeln demonstriert hat. AMD zielt darauf ab, Nvidia herauszufordern und strategische Schutzwälle im Bereich der 4D-Chiparchitekturen und Simulationsökosysteme zu errichten (Quelle: 36氪)

Kuaishous Kling AI beauftragt CICC und Goldman Sachs für Hongkong-IPO mit Zielvolumen von über 1 Milliarde US-Dollar : Kling AI, die Video-KI-Sparte von Kuaishou, hat CICC, Goldman Sachs und UBS als Konsortialbanken ausgewählt, um einen Börsengang in Hongkong voranzutreiben. Das Unternehmen plant ein Emissionsvolumen von mindestens 1 Milliarde US-Dollar und strebt ein Listing frühestens 2027 an. Im zweiten Quartal 2026 erzielte Kling AI bereits über 850 Millionen Yuan Umsatz. Das separate Listing soll eigenständige Finanzierungskanäle für die kostenintensive Forschung an Rechenclustern erschließen; Kuaishou wird die Mehrheitskontrolle behalten (Quelle: 36氪)

AI-Cloud-Infrastrukturanbieter Lambda plant Pre-IPO-Finanzierungsrunde über 4 Milliarden US-Dollar bei 14,5 Milliarden US-Dollar Bewertung : Wie das Wall Street Journal berichtet, bereitet der GPU-Cloud-Infrastrukturanbieter Lambda eine Finanzierungsrunde über bis zu 4 Milliarden US-Dollar bei einer Pre-Money-Bewertung von 14,5 Milliarden US-Dollar vor, angeführt von Coatue und Blackstone. Getrieben von Großaufträgen unter anderem von Anthropic wuchs das Auftragsvolumen auf 50 Milliarden US-Dollar an. Das Eigenkapital soll vor dem geplanten Börsengang den Bau von Rechenzentren der nächsten Generation sichern (Quelle: TechCrunch)
🌟 Community
Unternehmen zahlen „Kollaborationssteuer“ bei Agent-Einführung: 1 Stunde Ticket-Lösung erfordert 3 Stunden interne Abstimmung : Eine Umfrage der Kundenservice-Plattform Front unter 700 Führungskräften sorgt für Diskussionen: Die Daten zeigen, dass AI Agents die Personalkosten nicht unmittelbar senken, sondern durch ungelöste Übergaben und Ticket-Eskalationen eine massive ungemessene „Kollaborationssteuer“ verursachen. Unternehmen verbringen dreimal mehr Zeit mit systemübergreifenden Übergaben und Kontextprüfungen als mit der eigentlichen Problemlösung – was das Fehlen durchgängiger End-to-End-Observability als gravierendes Governance-Problem entlarvt (Quelle: )
Glücksspielwerbung in ChatGPT-Titeln analysiert: Tokenizer-Kontamination und fehlerhafte Truncation : Entwickler haben die technischen Ursachen aufgedeckt, warum in ChatGPT-Konversationstiteln vereinzelt illegale Kleinanzeigen auftauchten. Das Problem rührt daher, dass die Pre-Training-Daten des o200k-Tokenizers stark von hochfrequenten langen Token fragwürdiger Webseiten durchsetzt waren. Wenn das leichtgewichtige Titel-Inferenzmodell beim Generieren des EOS-Steuerzeichens eine Wahrscheinlichkeitsverschiebung erlebte, samplete es fälschlicherweise Werbefragmente mit hoher Wahrscheinlichkeit aus den seltenen Token-Clustern des Vokabulars (Quelle: 36氪)
Aufstieg Cloud-nativer Harness-Architekturen: K8s-Schöpfer entwickeln zentrale Governance-Lösung für AI Agents : Stacklok, gegründet von Mitgliedern des ursprünglichen Kubernetes-Kernteams, hat das Cloud-native Agent-Harness-Projekt Mecatl als Open Source veröffentlicht. In der Community wird über die Entwicklung von AI Agents von „lokalen Terminal-Skripten“ hin zu „zentral verwalteten Unternehmensplattformen“ diskutiert. Gefordert wird eine saubere Entkopplung von Agent-Status, MCP-Tool-Gateways und isolierten Sandbox-Umgebungen, um Unternehmensressourcen und Berechtigungen nicht an einzelne lokale Maschinen zu binden (Quelle: Latent Space)
Meta Muse erstellt Berichten zufolge Echtzeit-Dossiers über 4 Millionen Nutzer: Datenschutzbedenken wachsen : Aus der Community wurde bekannt, dass Metas AI Agent Muse stündlich detaillierte Dossiers auf Basis von Chatverläufen und Kommunikationsdaten von Nutzern aktualisiert, einschließlich sozialer Beziehungsgeflechte, zwischenmenschlicher Konflikte und persönlicher Vorlieben. Obwohl Meta betont, dass die Benutzer-VMs in isolierten Sandboxes laufen, sorgt der instanzübergreifende Mechanismus „geteilter Lernerfahrungen“ für erhebliche Bedenken hinsichtlich verdeckter Datenerfassung und gezielter Werbenutzung (Quelle: Reddit r/artificial)

Entwickler debattieren über unverständlichen KI-Jargon: Von CoT-Kompression bis zu Fehlanpassungen im Trainingskorpus : Entwickler-Communities beklagen zunehmend, dass neuere Coding-Modelle in Berichten kryptische Phrasen wie „15/15 all green, single-leg misfire“ verwenden. Diskussionen zeigen, dass dies teilweise darauf zurückzuführen ist, dass Anbieter Chains-of-Thought (CoT) zur Einsparung von Token drastisch zu abkürzenden Slangs verdichten. Einige Entwickler nutzen dies auch als Anlass, um die technischen Effizienzvorteile ultrakompakter Sprachformen für maximale Token-Kompression zu diskutieren (Quelle: 量子位)

Sicherheitslücke durch verschlüsselte Prompts: Selbstentschlüsselung von Agents wird zur Schwachstelle : Sicherheitsanalysen zeigen, dass Angreifer externe Filtermechanismen von Systemen wie Copilot mit verschlüsselten Instruktionen umgehen können. Der verarbeitende Agent entschlüsselt die Befehle eigenständig, greift auf lokale Geheimnisse zu und leitet diese über das Netzwerk nach außen. Tests ergaben, dass automatische Model-Routing-Mechanismen den Schutz extrem instabil machen, was belegt, dass die Modellselbstregulierung als Sicherheitsbarriere systematische Mängel aufweist (Quelle: Reddit r/artificial)

Grenzen der Miniaturisierung: Entwickler trainiert narratives Modell MacroStories mit nur 20.000 Parametern : Ein unabhängiger Entwickler hat das nur 81 KB große Sprachmodell MacroStories (19.969 Parameter) als Open Source veröffentlicht. Das Modell nutzt eine Architektur mit einem einzelnen Decoder und 4 rekurrenten Inferenzschritten, läuft extrem schnell auf Standard-CPUs oder im Cache von Mikrocontrollern und behält innerhalb eines begrenzten Vokabulars eine kohärente narrative Struktur bei – eine Erkundung der minimalen Rechengrenzen für sprachliche Kohärenz (Quelle: Reddit r/LocalLLaMA)

💡 Sonstiges
Netzausbau und Engpässe bei Transformatoren könnten noch vor KI-Chips zur harten Bremse für AI-Wachstum werden : Energiepolitische Analysen warnen davor, dass die Lieferzeiten für Hochspannungstransformatoren und schwere elektrische Ausrüstung bereits über fünf Jahre betragen, während die Stromlast von US-amerikanischen KI-Rechenzentren bis 2030 auf 50 GW anwachsen dürfte. Da Hersteller aus Furcht vor früheren Überkapazitäten vor überstürzten Werkserweiterungen zurückschrecken, entwickelt sich das strukturelle Missverhältnis in der physischen Strominfrastruktur zum gravierendsten realen Engpass für das unkontrollierte Wachstum der Rechenleistung (Quelle: Transformer)
Komplette Adobe-Design-Suite als Open Source per Reverse Engineering nachgebaut: Code-Modelle erschüttern traditionelle IP-Burggräben : Das Open-Source-Projekt Artcraft hat mithilfe fortschrittlicher Code-Modelle wie Opus 5.5 die Logik traditioneller Design-Suiten dekompiliert und in modernen Rust-Code überführt, um eine Clean-Room-Open-Source-Alternative auf Photoshop-Niveau zu schaffen. Die Community diskutiert intensiv darüber, wie die Fähigkeit von Code-Agents zum rasanten Reverse Engineering veralteter Software proprietäre Geschäftsmodelle und deren traditionelle Schutzwälle grundlegend untergräbt (Quelle: dotey、amasad)

Kartellklage gegen McDonald’s wegen mutmaßlicher Preisabsprachen bei Franchisenehmern über KI-Pricing-Tools : Vor einem Bundesgericht in Chicago haben Verbraucher eine Sammelklage gegen McDonald’s eingereicht. Sie werfen dem Konzern vor, dass der Einsatz dynamischer KI-Preistools bei unabhängigen Franchisenehmern einen horizontalen Austausch nicht-öffentlicher Vertriebsdaten und algorithmische Preisabsprachen darstelle, was den Wettbewerb verzerrt und Verbraucherrechte verletzt habe (Quelle: The Guardian)
