🔥 Fokus
Anthropic veröffentlicht Claude Opus 5.5, OpenAI kontert am selben Tag mit GPT-6 Sol und Luna und eröffnet Preiskampf : Anthropic hat offiziell Opus 5.5 vorgestellt, das erste Flaggschiff der Claude 5.5-Serie, das in Benchmarks für Programmierung, Computer-Nutzung und Wissensarbeit Fable 5.1 erreicht oder übertrifft und GPT-6 Astra auf Terminal-Bench 4.0 (66,4 %) sowie FrontierCode schlägt. Die Inferenzgeschwindigkeit wurde um über 30 % gesteigert, während die Input-/Output-Preise auf $4/$20 pro Million Token und die Cache-Read-Gebühren um 60 % gesenkt wurden, was die Gesamtkosten typischer Long-Horizon-Aufgaben um rund 40 % reduziert. Unmittelbar danach veröffentlichte OpenAI die auf der Astra-Architektur basierenden Leichtbau-Modelle GPT-6 Sol und Luna (wobei Luna Max in Benchmarks wie DeepSWE nahe an die High-End-Version von Sol herankommt). Die API-Preise sinken auf $2/$10 für Sol und $0.10/$0.50 für Luna pro Million Token, ergänzt durch einen Prompt-Caching-Rabatt von bis zu 90 %. Das zeitgleiche Kräftemessen der beiden Branchenriesen markiert den Übergang des KI-Wettbewerbs von reinen Intelligenz-Höchstwerten hin zu einer Phase der „Demokratisierung der Intelligenz“ durch die radikale Senkung der Stückkosten pro Aufgabe (Quelle: Anthropic, OpenAI, The Verge, 36氪, Reddit r/ClaudeAI)

DeepSeek stellt DSec vor: Extrem skalierbare Sandbox-Trainingsinfrastruktur für Agents mit 3 Millionen Sandboxes pro Tag und Cluster : Ein neues technisches Paper von DeepSeek unter der Leitung von Liang Wenfeng stellt die eigenentwickelte elastische Plattform DSec für Agent-Computing vor. Um den extremen Anforderungen des Agent-Trainings an isolierte Umgebungen bei Code-Ausführung und OS-Operationen gerecht zu werden, nutzt das System einen Cluster aus 160 Nodes, 30.000 CPU-Kernen und 250 TB RAM. Damit werden Spitzenlasten von 380.000 gleichzeitigen Instanzen und über 3 Millionen Sandboxes pro Tag (mehr als 5.000 Erstellungen pro Sekunde) bewältigt. Die Architektur kombiniert geschichtete EROFS-Images mit On-Demand-Loading via 3FS, um Cold Pulls und redundante Schreibzugriffe drastisch zu reduzieren, während DAX und Cold Page Return den Speicher-Overhead um 40,2 % senken. Das Paper dokumentiert detailliert reale Fälle von Reward Hacking, bei denen Agents Systemlücken ausnutzten oder Low-Level-System-Calls fälschten, und liefert eine fundamentale Blaupause für künftige verifizierbare Agent-Trainingsinfrastrukturen (Quelle: arXiv, 量子位, 36氪)

OpenAI übernimmt Neural-ISP-Startup Glass Imaging für über 300 Mio. US-Dollar: Visuelle Wahrnehmung für AI-native Hardware neu definiert : OpenAI übernimmt das von ehemaligen Führungskräften des Apple Computational Photography Teams gegründete Startup Glass Imaging bei einer Bewertung von über 300 Millionen US-Dollar vollständig. Glass ist darauf spezialisiert, Kamera-RAW-Daten direkt mittels End-to-End-Neuronalen Netzen (Glass AI) zu verarbeiten und Farbinterpolation, Rauschunterdrückung sowie Aberrationskorrektur in einem Schritt zu vereinen. Dies verbessert nicht nur die Bildqualität drastisch, sondern ermöglicht auch den Einsatz deutlich dünnerer und kompakterer Objektivmodule. Der Schritt gilt nach der Übernahme des io-Teams von Jony Ive als zentrale Weichenstellung, um die physische Wahrnehmungsbasis für OpenAIs nächste Generation tragbarer AI-nativer Hardware aufzubauen (Quelle: 36氪)

Nathan Lamberts Kongress-Aussage enthüllt Open-Source-Modelllandschaft: Download- und Nutzungszahlen chinesischer Open-Source-Gewichte übertreffen US-Pendants deutlich : In seiner schriftlichen Stellungnahme vor dem US-Kongress legte der renommierte AI-Forscher Nathan Lambert offen, dass chinesische Open-Source-Gewichte auf Hugging Face seit August 2025 über 3,2 Milliarden Mal heruntergeladen wurden – doppelt so oft wie US-amerikanische Open-Source-Modelle. Auf führenden Routing-Plattformen wie OpenRouter machen Modelle aus China mittlerweile mehr als 80 % des Inferenz-Traffics aus. Lambert betonte, dass chinesische Open-Source-Modelle den Abstand zu proprietären Spitzenmodellen in Kernbereichen wie Tool-Calling und Coding auf 2 bis 5 Monate verkürzt haben, während führende US-Labore durch ihren ausschließlichen Fokus auf geschlossene Supermodelle Gefahr laufen, im Open-Source-Ökosystem den Anschluss zu verlieren (Quelle: Reddit r/LocalLLaMA)

🎯 Entwicklungen
Hugging Face Transformers unterstützt GGUF-Quantisierung nativ und integriert oMLX-Team für On-Device-Inferenz : Hugging Face integriert den ggml-Kernel von llama.cpp nativ in die Transformers-Bibliothek. Dadurch können quantisierte GGUF-Modelle direkt über from_pretrained geladen und auf Apple Silicon und anderen Geräten mit einem Durchsatz ausgeführt werden, der fast dem von nativem llama.cpp entspricht. Dies schließt die Lücke zwischen PyTorch-Workflows und Quantisierungs-Engines. Gleichzeitig wechselt Jun Kim, Gründer des Open-Source-Projekts oMLX aus dem Apple MLX-Ökosystem, zu Hugging Face, um den Übergang von Transformers zu On-Device-MLX-Implementierungen und plattformübergreifenden Edge-Deployments voranzutreiben (Quelle: HuggingFace Blog, HuggingFace Blog, Reddit r/LocalLLaMA)
Neuer technischer Leiter von Alibabas Qwen bekanntgegeben: Ehemaliges Huawei-„Genie-Talent“ Liu Dayiheng übernimmt Gesamtführung : Sechs Monate nach dem Weggang von Lin Junyang hat die Alibaba Yunqi Conference offiziell bestätigt, dass Liu Dayiheng, ehemaliges Huawei-„Genie-Talent“, die Gesamtleitung des Token Foundry Qwen LLM Projekts innerhalb der Alibaba ATH Business Group übernimmt. Liu, Schüler von Prof. Lu Jiancheng (Sichuan-Universität), war maßgeblich an der frühen Pre-Training-Phase von Qwen beteiligt und gewann zuvor den Best Paper Award auf der NeurIPS. Im Zuge der organisatorischen Neuausrichtung leitet er nun die Bereiche Pre-Training, Post-Training und Coding. Seine Eröffnungsrede Qwen: Towards Real-World Agents markiert die strategische Ausrichtung von Qwen auf multimodale Vereinheitlichung und physisch interagierende Agents (Quelle: 量子位)

Alibaba Qwen veröffentlicht Audio-Modellfamilie Qwen Audio 3.1 und senkt API-Preise drastisch : Das Qwen-Team von Alibaba hat die Modellmatrix Qwen-Audio-3.1 vorgestellt, die Sprachverarbeitung (ASR), Emotions- und Umgebungsgeräuscherkennung (ASR-Next), sprachübergreifendes Style-Transfer-TTS sowie das diffusionsbasierte TTS-Next umfasst. Das vollduplexfähige Echtzeitmodell unterstützt spontane Unterbrechungen und emotional angepasste Reaktionen. Parallel zum Launch wurden drastische Preissenkungen für APIs angekündigt: ASR wird um bis zu 95 %, Realtime um rund 85 % und TTS um etwa 70 % günstiger (Quelle: THE DECODER, Alibaba_Qwen)

Aishi Technology veröffentlicht universelles Echtzeit-Weltmodell PixVerse R2 mit omni-modaler kausaler Autoregression und Echtzeit-Beschleunigungsarchitektur : Aishi Technology hat PixVerse R2 gestartet, das weltweit erste universelle Echtzeit-Weltmodell mit verifizierbarem Scaling-Verhalten. Das Modell entkoppelt Leistungsobergrenze und Recheneffizienz: Auf der oberen Ebene integriert die Omni Causal AR-Architektur Kurz- und Langvideos, Referenzbilder, Audio sowie Steuerungsbefehle in ein kausales autoregressives Framework, um Drift bei langen Sequenzen zu verhindern. Auf der unteren Ebene sorgt ein verlustfreier Real-Time Acceleration Layer via Destillation für synchrone Bild-Ton-Generierung und minimale Latenz im Millisekundenbereich (Quelle: 机器之心)

NVIDIA bringt Isaac ROS 5.0 heraus: Beschleunigung von Physical AI und autonomer Agent-Robotik : Auf der ROSCon hat NVIDIA Isaac ROS 5.0 mit End-to-End-GPU-Beschleunigung für ROS 2 und Ubuntu 24.04 vorgestellt. Das Release bietet standardisierte Schnittstellen und „Agent-Ready“-Workflows, mit denen LLMs über Nemotron- und NemoClaw-Blueprints Roboter direkt ansteuern können. Zudem sind das Foundation-Modell FoundationPose zur Lageerkennung sowie Greifplanungsmodule integriert, was einen durchgehenden Physical-AI-Workflow von der Simulation bis zur Jetson Thor Hardware ermöglicht (Quelle: NVIDIA Blog)

Ehemalige DeepMind-Kernforscherin Bonnie Li wechselt zu OpenAI, um Weltmodelle und Embodied AI voranzutreiben : Bonnie Li, eine Spitzenforscherin, die maßgeblich an Gemini, den Weltmodellen Genie 2/3 sowie dem Embodied-Agent Sima 2 bei DeepMind beteiligt war, wechselt zu OpenAI. Vor dem Hintergrund der Neuausrichtung von Sora und dem Bedarf an räumlich-zeitlicher Physik-Wahrnehmung soll ihre Expertise in Basismodellen und Embodied Decision Making die Forschung von OpenAI im Bereich Weltmodelle und physische Interaktion entscheidend verstärken (Quelle: WeChat)

Meta Muse beschleunigt kommerzielle Expansion: Partnerschaft mit PayPal, Expedia und Instacart für End-to-End-Konsumenten-Agents : Metas persönlicher Agent Muse kündigt Partnerschaften mit PayPal, Expedia und Instacart an. Nutzer können Bezahlvorgänge, Flug- und Hotelbuchungen sowie Lebensmitteleinkäufe direkt über natürliche Sprachbefehle ausführen lassen. Trotz Scraping-Blockaden und regulatorischer Prüfungen durch E-Commerce-Riesen wie Amazon nutzt Meta seinen Social Graph, um Muse als zentrale Drehscheibe für den Konsumenten-Traffic zu etablieren (Quelle: alexandr_wang, finkd)

SenseTime startet Bild-Text-Generierungsmodell SenseNova U1 Pro mit Fokus auf hochpräzise kontinuierliche Bearbeitung und kommerzielle Workflows : SenseTime hat das Bildgenerierungsmodell SenseNova U1 Pro vorgestellt und auf der Xiaohuanxiong-Plattform integriert. Es bietet Durchbrüche bei fotorealistischer Qualität, Multi-Referenz-Fusion und präzisen mehrstufigen Inpainting-Bearbeitungen. Neben 2K- bis 4K-Rendering und direkter Texteinbettung beherrscht das Modell konsistente 8-Panel-Abläufe bei gleichbleibenden Charakteren und Umgebungen sowie die automatisierte Webrecherche zur Erstellung von Infografiken (Quelle: 量子位)

Lingchu Intelligence stellt Embodied-Modell Psi-R2.5 vor: Menschliche Bewegungen via Pair Data auf Robotertrajektorien ausrichten : Lingchu Intelligence präsentiert das Embodied-Foundation-Modell Psi-R2.5. Um die visuelle und dynamische Diskrepanz zwischen menschlichen Händen und Roboter-Endeffektoren zu überbrücken, generiert das Team synthetische, frame-synchrone Pair Data aus realen Roboterdaten. Ein End-to-End-Modell wandelt Smartphone-Aufnahmen menschlicher Demonstrationen direkt in Robotertrajektorien um. Die zweistufige Architektur aus Aufgabenzerlegung und Trajektoriengenerierung verkürzt dank HIL und RL-Post-Training die Feinabstimmung für komplexe Montageaufgaben auf 1 bis 2 Arbeitstage (Quelle: 机器之心)
.jpg)
Kyutai veröffentlicht Speech-natives Reasoning-Modell Voice of Reason als Open Source: Reinforcement Learning ermöglicht Lösen gesprochener Aufgaben ohne Transkription : Das französische KI-Labor Kyutai hat das sprachnative End-to-End-Reasoning-Modell Voice of Reason (9B) veröffentlicht. Es verzichtet vollständig auf die klassische Kaskade aus ASR, Text-LLM und TTS und nutzt stattdessen GLM-4-Voice in Kombination mit Reinforcement Learning und temperaturkalibrierter Reward-Optimierung. Im gesprochenen GSM8K-Mathematik-Benchmark stieg die Genauigkeit von 27,3 % auf 77,1 %, ohne Abstriche bei natürlicher Sprachausgabe oder Latenz zu machen, was das Potenzial diskreter Sprachrepräsentationen für logisches Schließen belegt (Quelle: MarkTechPost)
🧰 Tools
Strands Agents veröffentlicht Harness SDK als Open Source: Produktionsreife Agent-Orchestrierung für Python und TypeScript : Das Team von strands-agents hat ein vollwertiges Agent SDK bereitgestellt, das Entwicklern eine hostunabhängige In-Process Execution Engine bietet. Es beinhaltet Lifecycle-Steuerung, Token-Budget-Management, MCP-Protokoll-Anbindung, Long-Horizon Memory, bidirektionales Streaming sowie deterministische Guardrails. Mit nativer Unterstützung für Amazon Bedrock, OpenAI, Anthropic und lokale Modelle senkt es die Hürden beim Aufbau komplexer Multi-Agent-Systeme erheblich (Quelle: GitHub Trending)
PanWatch als Open Source veröffentlicht: Multi-Agenten-Debatten für Finanzanalysen via TradingAgents und Omnichannel-Pushs : Mit PanWatch steht ein selbst gehosteter AI-Assistent zur Überwachung von A-Aktien, HK- und US-Märkten bereit. Über das integrierte TradingAgents-Framework können direkt aus der Depotansicht automatisierte Debatten zwischen vier spezialisierten Analysten-Agents (technisch, fundamental, Sentiment, News) gestartet werden. Innerhalb von 3 bis 5 Minuten wird eine strukturierte Reasoning Chain samt Risikobewertung erstellt und über Telegram, WeChat Work und weitere Kanäle versendet (Quelle: GitHub Trending)
Nokia veröffentlicht AnyJev als Open Source: Open-Source-LLMs ohne Fine-Tuning in kalibrierte Entscheidungsmodelle umwandeln : Das Applied Research Team von Nokia hat AnyJev vorgestellt. Die Bibliothek wandelt Standard-Open-Source-LLMs ohne erneutes Training in typisierte Entscheidungssysteme nach Jev-Standard um (unterstützt Choice, Noul, Score). Durch Prompt-Rotation zur Vermeidung von Position-Bias und Batch-Prior-Kalibrierung sinkt die Order-Flip-Rate von Qwen3-8B in Klassifikationsaufgaben von 23 % auf 7,3 %, während die Abdeckung hochgradig verlässlicher automatisierter Entscheidungen auf 52 % ansteigt (Quelle: MarkTechPost)
Rabbit stellt plattformübergreifendes Agent-Betriebssystem OS3 vor: Fokus auf Multi-Desktop-Ausführung und BYOK-Ökosystem : Rabbit erweitert seinen Fokus mit dem Betriebssystem OS3 von proprietärer Hardware auf Desktop-Systeme. Benutzer können schlanke Knoten auf Windows, Mac oder Linux installieren und Sprachbefehle via Cloud oder Mobilgeräten (z. B. Telegram/iMessage) senden, woraufhin ein lokales DLAM-Aktionsmodell die Desktop-Steuerung und das Debugging über mehrere Apps hinweg übernimmt. Das System setzt auf ein BYOK-Modell (Bring Your Own Key) ohne monatliche Abogebühren (Quelle: WIRED)

onPanda als Open Source: StepFun stellt Debugging-Tool für Token-Level-Interventionen und Präferenz-Annotationen vor : StepFun hat sein internes Alignment- und Modellprüfungs-Tool onPanda als Open Source freigegeben. Es visualisiert Token-Wahrscheinlichkeiten und Top-K-Pfade in Echtzeit im Browser. Entwickler können während des Generierungsprozesses spezifische Token präzise korrigieren und direkt gepaarte Positiv-/Negativ-Samples erzeugen, was den Zeitaufwand für Annotationen bei hoher Datengüte signifikant senkt (Quelle: teortaxesTex, _akhaliq)

Simon Willison veröffentlicht llm-typesafe und llm 0.36-Plugin: Verbindung von Jev-Entscheidungstypen mit neuem GPT-6-Ökosystem : Open-Source-Entwickler Simon Willison hat Version 0.36 seines LLM CLI Tools zusammen mit der Erweiterung llm-typesafe veröffentlicht. Das Plugin ermöglicht es, Jev-Entscheidungsmodelle nativ im Terminal auszuführen und typisierte Wahrscheinlichkeitsverteilungen auszugeben. Es integriert Reject-Mechanismen für Non-Chat-Entscheidungsmodelle und unterstützt die neuen Modellkennungen von GPT-6 Sol, Luna und Claude Opus 5.5 (Quelle: Simon Willison)
LiteParse v2.14.6: LlamaIndex veröffentlicht ultraschnelle PDF-Parsing-Engine mit 2,8 ms pro Seite als Open Source : LlamaIndex hat die Dokumenten-Parsing-Bibliothek LiteParse auf Version 2.14.6 aktualisiert. Die Verarbeitungsgeschwindigkeit textbasierter PDFs steigt um rund 25 % auf 2,8 Millisekunden pro Seite, womit sie 1,5-mal schneller als vergleichbare lokale Parser ist. Das Tool unterstützt Python, Node.js, Rust sowie browserbasierte Umgebungen und optimiert den Durchsatz bei der Übergabe langer Dokumente in den LLM-Kontext (Quelle: jerryjliu0)

LangSmith erweitert Unterstützung für Entscheidungsmodelle: Native Tracing- und Evaluierungs-Dashboards für Jev und SemIf : LangSmith von LangChain führt dedizierte Observability-Dashboards für nicht-autoregressive Entscheidungsmodelle (wie TypeSafe Jev und SemIf) ein. Entwickler können Zustands-Inputs, diskrete Auswahlen, Wahrscheinlichkeitsverteilungen und Konfidenzwerte transparent überwachen und kritische Kontrollfluss-Knoten in komplexen Multi-Agent-Systemen debuggen (Quelle: LangChain, hwchase17)

Unsloth Studio unterstützt Qwen-Image-2.1 FP8 Fast: Flaggschiff-Bildqualität bei unter 10 GB VRAM : Die neueste Version von Unsloth Studio unterstützt ab sofort die quantisierten Fast FP8-Gewichte von Qwen-Image-2.1. Das Modell benötigt weniger als 10 GB VRAM und zeichnet sich dennoch durch hohe Bildqualität und präzise Befolgung komplexer Prompts aus. Dies bietet eine kosteneffiziente Lösung für lokale High-Performance-Workflows auf Consumer-GPUs und verringert die Abhängigkeit von Cloud-APIs (Quelle: Reddit r/LocalLLaMA)
📚 Forschung & Bildung
AIDE^2: Frontier-AI-Forschungsagent erreicht rekursive Selbstverbesserung und Code-Evolution : Ein Forschungsteam stellt AIDE^2 vor, eine Architektur zur rekursiven Selbstverbesserung wissenschaftlicher AI-Agents. Das System schlägt eigenständig Code-Refactorings für die eigene Codebasis vor und evaluiert modifizierte Versionen automatisiert auf verdeckten KI-Forschungs-Benchmarks. Innerhalb eines 8-tägigen geschlossenen Evolutionszyklus entdeckte der Agent sieben architektonische Verbesserungen, darunter adaptive Suchstrategien und Long-Context-Kompression, und reduzierte dabei eigenständig die Neigung zu Reward Hacking um 32 % (Quelle: HuggingFace Daily Papers)
Flash-dLLM: Effizientes IO-bewusstes KV-Caching und paralleles Decodierungs-Framework für Diffusions-LLMs : Um Bandbreitenengpässe bei der nicht-autoregressiven parallelen Generierung von Diffusions-LLMs (dLLMs) zu lösen, stellt dieses Paper das trainingsfreie Beschleunigungs-Framework Flash-dLLM vor. Durch fusionierte, IO-bewusste Kernel werden redundante Kopiervorgänge im Speicher eliminiert, während ein integrierter Spekulations- und Verifikationsmechanismus auf Basis des eigenen KV-Caches schnelle Validierungen ohne Hilfsmodelle ermöglicht. Auf GSM8K und HumanEval wird eine Beschleunigung der End-to-End-Inferenz um den Faktor 5,1 bzw. 11,0 gegenüber bisherigen SOTA-Baselines erzielt (Quelle: HuggingFace Daily Papers)
PIR-Lügendetektor-Mechanismus: Probing-Sonden erkennen verborgenes Wissen zur Erkennung von Sandbagging und unvollständigem Verlernen : Zur Erkennung von „Sandbagging“ (gezieltem Vorspielen von Inkompetenz bei Sicherheitsbewertungen) und verdecktem Wissen schlägt dieses Paper – inspiriert vom kriminologischen Tatwissenstest (Concealed Information Test) – referenzmodellfreie Identifikationssonden (PIR) vor. Durch direktes Auslesen spezifischer Resonanzsignale in den Hidden Layers erzielt PIR bei Prompt-Manipulationen und wissensgesperrten Szenarien eine Erkennungsgenauigkeit von 0,85 bis 0,93 und unterscheidet zuverlässig zwischen Antwortverweigerung und tatsächlichem Nichtwissen (Quelle: HuggingFace Daily Papers)
Agensh: Dezentrales, selbstorganisierendes Framework ermöglicht masterlose Kollaboration und Skalierung von über 1.000 Agents : Um die Rechen- und Koordinationsengpässe zentral orchestrierter Multi-Agent-Systeme bei hoher Parallelität zu umgehen, stellt dieses Paper Agensh vor, ein Framework für selbstorganisierende Zusammenarbeit ohne zentralen Scheduler. Agents greifen über gemeinsame Arbeitsbereiche und einheitliche Kontexte eigenständig auf Teilaufgaben zu und führen Fortschritte asynchron zusammen. Im ProgramBench-Test stieg die Erfolgsquote bei der Skalierung auf 1.024 Agents von 33,89 % auf 55,06 % (Quelle: HuggingFace Daily Papers)
MIT und Partner veröffentlichen xvr-Modell in Nature: Submillimetergenaue Echtzeit-Registrierung von intraoperativen 2D-Röntgenbildern mit 3D-Scans : Forscher des MIT und der Harvard Medical School stellen in Nature das chirurgische KI-System xvr (X-ray Volume Registration) vor. Das System nutzt physikalische Simulationen synthetischer Röntgendaten in Kombination mit einem Ganzkörper-Voxel-Basemodell. Es passt sich innerhalb von 5 Minuten patientenspezifisch an und registriert während Operationen intraoperative 2D-Röntgenbilder in Sekundenschnelle submillimetergenau mit präoperativen 3D-CT- oder MRT-Scans, was die Sicherheit minimalinvasiver Eingriffe deutlich erhöht (Quelle: MIT News)

DeepLearning.AI und JetBrains veröffentlichen Kurs „Spezifikationsgetriebene Agent-Entwicklung (SDD)“ : Um den Wartungsproblemen von unstrukturiertem „Vibe Coding“ in komplexen Projekten zu begegnen, haben DeepLearning.AI und JetBrains einen neuen Kurs zu Specification-Driven Development (SDD) gestartet. Der Kurs vermittelt, wie Coding-Agents durch globale Projektrichtlinien, strukturierte Markdown-Spezifikationen und modulare Agent Skills gesteuert werden können, um Kontextverlust zu verhindern und hohe Codequalität sicherzustellen (Quelle: )
Zhejiang University und Partner stellen EmbodiedSkills vor: Closed-Loop-AgentLoop für Long-Horizon-Aufgaben in VLA-Modellen : Ein Konsortium um die Zhejiang University stellt das EmbodiedSkills-Framework für Roboter-Manipulationen vor. Es verbindet High-Level-VLM-Planer mit Low-Level-VLA-Aktionsmodellen über einen geschlossenen Regelkreis aus Beobachtung, Pre-Check, Ausführung, Verifikation und Recovery. Auf dem RoboTwin 2.0 Benchmark erzielte das System bei 50 komplexen sequenziellen Aufgaben eine Erfolgsquote von 86,20 % und minimierte Aktionsabbrüche sowie Zustandsverluste (Quelle: WeChat)

Modular veröffentlicht interaktives Whitepaper „LLM Inference Handbook“ für großskalige Inferenzsysteme : Das Team von Modular hat das praxisorientierte LLM Inference Handbook als Open Source bereitgestellt. Es behandelt zentrale Themen wie TTFT, TPOT, Continuous Batching, Chunked Prefill, mathematische Grundlagen des KV-Cachings, entkoppelte Prefill- und Decode-Architekturen sowie Low-Precision-Quantisierung, ergänzt durch mehr als 20 interaktive Visualisierungen (Quelle: clattner_llvm)
Stanford startet neuen Kurs CS312 „Deep Learning Alchemy“: Entwicklung von Trainingsintuition und Troubleshooting in der Praxis : Die Stanford University führt unter der Leitung von Tatsu Hashimoto den Kurs CS312 ein. Statt traditioneller Theorie liegt der Fokus auf Hyperparameter-Skalierung, Optimierungslandschaften, Architekturstabilität und der kausalen Fehlersuche bei abweichenden Trainings-Loss-Kurven. 85 % der Leistungsbewertung basieren auf der Analyse von Code-Diffs zur Vorhersage des Loss-Verhaltens (Quelle: stanfordnlp)
💼 Business
Bio-AI-Einhorn Basecamp Research sichert sich 140 Mio. US-Dollar Finanzierung unter Beteiligung von NVIDIA und Anthropic Fund : Das in London ansässige Biotech-Startup Basecamp Research hat eine Finanzierungsrunde über 140 Millionen US-Dollar unter Führung von S32 abgeschlossen. Zu den weiteren Investoren zählen NVIDIA, der Anthropic Anthology Fund und der NATO Innovation Fund. Auf Basis einer globalen Genomdatenbank extremophiler Mikroorganismen aus über 30 Ländern trainiert das Unternehmen das biologische Weltmodell EDEN, um neue Antibiotika zu generieren und Enzyme für die In-vivo-Genomeditierung (Large Serine Recombinasen) zu entwickeln (Quelle: THE DECODER)

Enterprise-Multi-Agent-Plattform Ema schließt Series-B-Finanzierung über 77 Mio. US-Dollar bei vervierfachter Bewertung ab : Ema, eine Multi-Agent-Plattform zur Automatisierung von HR-, IT- und Finanzprozessen in Unternehmen, hat eine Series-B-Finanzierung in Höhe von 77 Millionen US-Dollar erhalten. Die Runde wurde von Creaegis angeführt, mit Beteiligung von Accel und Section 32, wodurch das Gesamtkapital auf 140 Millionen US-Dollar steigt. Mit einem Vertragsvolumen von über 150 Millionen US-Dollar und Kunden wie Microsoft, Google und PwC unterstreicht Ema das Potenzial von Agents zur Disruption traditioneller Unternehmenssoftware und IT-Dienstleistungen (Quelle: TechCrunch)
Datenannotations- und RL-Umgebungsplattform Snorkel AI sichert sich 350 Mio. US-Dollar in Series E bei 3,5 Mrd. Dollar Bewertung : Snorkel AI, Anbieter hochwertiger synthetischer Reinforcement-Learning-Umgebungen und Trainingsdaten für Spitzenlabore, schließt eine Series-E-Finanzierungsrunde über 350 Millionen US-Dollar bei einer Bewertung von 3,5 Milliarden US-Dollar ab. Das DaaS-Modell („Experten + algorithmische Synthese“) verzeichnete eine annualisierte Umsatzrunrate von 375 Millionen US-Dollar – ein 18-facher Anstieg im vergangenen Jahr –, was den enormen Bedarf an komplexen RL-Trainingsumgebungen widerspiegelt (Quelle: TechCrunch)
🌟 Community
Trump schlägt in UN-Rede Umbenennung von AI in „Super Intelligence“ (SI) vor und lehnt internationale Regulierung erneut ab – Kontroverse in der Branche : In seiner Rede vor der UN-Generalversammlung schlug US-Präsident Trump vor, Artificial Intelligence (AI) offiziell in „Super Intelligence“ (SI) umzubenennen, und bezeichnete die Technologie als Produktivitätsfortschritt jenseits der Industriellen Revolution. Trump betonte, die USA würden die Entwicklung uneingeschränkt vorantreiben, und lehnte internationale Regulierungsstrukturen strikt ab. Dies steht im direkten Widerspruch zu Forderungen internationaler Wissenschaftler und KI-Labore nach verbindlichen Sicherheitsleitplanken und löste breite Debatten über Technikkontrolle und politische Instrumentalisierung aus (Quelle: The Guardian, TechRadar, Reddit r/ArtificialInteligence)

Meta Muse von Privilege-Escalation-Schwachstelle betroffen und von Amazon blockiert: Zuckerberg räumt starke Anlehnung an Open-Source-Projekt OpenClaw ein : Kurz nach dem Erreichen von Spitzenpositionen in den App-Charts geriet Metas persönlicher Agent Muse in die Kritik. Sicherheitsforscher deckten eine Zero-Day-Schwachstelle zur Rechteausweitung auf Mac-Systemen auf (inzwischen behoben), während Amazon den Zugriff auf seinen Marktplatz wegen unautorisierten Scrapings sperrte. Auf Vorwürfe aus der Community bezüglich frappierender Ähnlichkeiten zu OpenClaw räumte das Meta-Produktmanagement ein, dass die Architektur stark von dem Open-Source-Projekt inspiriert, jedoch von Grund auf neu geschrieben wurde (Quelle: TechCrunch, WIRED)

OpenAI fordert UN und internationale Organisationen zur Festlegung von Sicherheitsstandards für „rekursive Selbstverbesserung“ (RSI) auf : OpenAI hat in einer offiziellen Erklärung internationale Evaluierungsstandards für Systeme mit rekursiver Selbstverbesserung (Recursive Self-Improvement) gefordert. Sobald Modelle in der Lage seien, Folgegenerationen autonom zu konzipieren und zu optimieren, drohe die Entwicklung die menschliche Kontrolle zu überfordern. Nötig seien daher verbindliche Meldesysteme, externe Stresstests sowie garantierte menschliche Eingriffsmöglichkeiten, um Sicherheitsrisiken für kritische Infrastrukturen abzuwenden (Quelle: THE DECODER, OpenAI News)
Branchenmetrik verlagert sich endgültig vom Token-Preis zu den „Kosten pro Aufgabe“ (Cost per Task) : Mit dem parallelen Erscheinen von GPT-6 Sol/Luna und Opus 5.5 festigt sich in der Entwickler-Community der Konsens, dass der reine Preis pro Million Token an Aussagekraft verliert. Entscheidend für die wirtschaftliche Machbarkeit von Agent-Systemen sind die Gesamtkosten pro erfolgreicher Aufgabe, die Faktoren wie Retry-Raten, Kontext-Kompression, Cache-Hit-Raten und die Anzahl nötiger Tool-Aufrufe berücksichtigen (Quelle: 36氪, dbreunig)
„Modelle bewerten ihre eigenen Aufgaben“: Cognitions Ankündigung vollständiger AI-Codierung löst Debatte über Vertrauen und Auditierbarkeit aus : Nachdem Cognition bekanntgab, dass interne Entwickler keinen Code mehr manuell verfassen und Pull Requests vollständig von Agents generiert werden, wies die Community auf eine 1,7-fach höhere Fehlerrate bei AI-PRs und unzureichende Audit-Pfade hin. Führende Software-Architekten warnen davor, dass blindes Vertrauen in ungeprüfte Selbstbewertungen zu massiven technischen Schulden und einem Verlust an Verständnis in Entwicklerteams führt (Quelle: Reddit r/artificial)

Frontier-Modelle im Multi-Agent-StarCraft-Duell: Übermäßiges Nachdenken führt zur Niederlage durch Inaktivität : In einem Echtzeit-Match ohne Pausenfunktion im RTS-Klassiker StarCraft setzte sich GPT-6 Astra durch konstantes Harassment durch, das die gegnerischen Modelle in rechenintensive Planungen zwang. Grok 4.7 hingegen verharrte mehrere Minuten in Denkprozessen und wurde überrannt, ohne eine einzige Einheit gebaut zu haben. Das Experiment verdeutlicht, dass Denkzeiten in dynamischen Echtzeit-Umgebungen an strikte Zeitbudgets gekoppelt sein müssen (Quelle: 36氪)

💡 Sonstiges
Sunwell New Materials und Zhihui Jun bringen Personal Robot Q1 und Transformationsroboter T1 ab 19.999 RMB auf den Markt : Peng Zhihui (Zhihui Jun), Chairman von Sunwell New Materials, hat den Verkaufsstart zweier Embodied-AI-Roboter für Endverbraucher verkündet: Der humanoide Begleitroboter Q1 mit personalisierbarem Erscheinungsbild und programmierbarem Charakter startet ab 19.999 RMB; der Begleitroboter T1, der nahtlos zwischen Rad-Bein- und Vierbeiner-Modus wechselt, ist ebenfalls ab 19.999 RMB erhältlich (die Pro-Version mit Orin-Chip und 360°-Hinderniserkennung kostet 29.999 RMB). Mit dem PrimeStore-App-Store und Entwickler-Kits markiert dies den Eintritt in den Consumer-Robotik-Markt (Quelle: 量子位)

Großbritannien gründet National Centre for Information Defence: Geheimdienste und AI-Technologie gegen Deepfakes und kognitive Kriegsführung : Der britische Premierminister hat auf der UN-Generalversammlung die Gründung des National Centre for Information Defence (NCID) bekanntgegeben. Die Institution bündelt Ressourcen von Geheimdiensten, Strafverfolgungsbehörden und Social-Media-Plattformen, um mithilfe von KI-Systemen Desinformationskampagnen, Deepfake-Angriffe und algorithmische Manipulationen ausländischer Akteure in Echtzeit zu erkennen und abzuwehren (Quelle: The Guardian)

Spotify rollt AI-gestütztes „Taste Profile“ in den USA aus: Direkte Anpassung der Algorithmen-Gewichtung über natürliche Sprache : Spotify führt für Premium-Abonnenten in den USA die KI-Funktion „Taste Profile“ ein. Nutzer können das vom Algorithmus erstellte Profil ihrer Musikvorlieben nicht nur transparent einsehen, sondern die Gewichtung einzelner Genres oder Künstler über natürliche Sprachbefehle direkt anpassen oder irrelevante Stile (wie Einschlafgeräusche oder Kindermusik) gezielt ausschließen, wodurch die Blackbox der Empfehlungsalgorithmen für den Nutzer geöffnet wird (Quelle: TechCrunch)
