🔥 Fokus
Sicherheitsforscher knacken interne Codebase von OpenAI mithilfe von Claude : Das Sicherheitsforschungsteam Hacktron AI gab bekannt, dass Forscher im Rahmen eines Bug-Bounty-Programms mit Unterstützung von Claude Opus 5 innerhalb von 72 Stunden OpenAI-Mitarbeiterkonten kompromittiert und einen verifizierenden PR an das zentrale private Monorepo (openai/openai), in dem die Algorithmus-Geheimnisse lagern, übermittelt haben. Die Angriffskette begann mit einer libheif-Heap-Buffer-Overflow-Schwachstelle in der Bild-Upload-Komponente des Discourse-Forums und übernahm in Kombination mit einer OpenAI SSO-Identitäts-Fehlkonfiguration das mit GitHub verknüpfte Codex-Konto eines Mitarbeiters, wobei die LLM-Token-Kosten unter 3.000 US-Dollar lagen. Der Vorfall löste in der Branche enorme Erschütterung und Alarmbereitschaft hinsichtlich der rasanten Demokratisierung hochgefährlicher Cyberangriffsfähigkeiten durch Frontier-KI sowie der Verwundbarkeit des Eigenschutzes von Spitzenlaboren aus (Quelle: The Wall Street Journal, 36氪)

Alibaba DAMO Academy veröffentlicht universelles medizinisches Bildgebungs-Großmodell RADAR in „Science“ und stellt es vollständig Open Source zur Verfügung : Das weltweit erste universelle Abdomen-Bildgebungs-Großmodell auf Expertenniveau, DAMO RADAR, das von der Alibaba DAMO Academy gemeinsam mit Dutzenden medizinischen Einrichtungen wie dem First Affiliated Hospital der Zhejiang-Universität entwickelt wurde, ist in der Hauptausgabe von Science erschienen. Das Modell überwindet den Engpass traditioneller medizinischer KI, die auf einzelne Krankheiten beschränkt war. Durch feingranulares Bild-Text-Alignment auf Organebene und adaptives kontrastives Modellieren kann ein einzelnes Modell 146 Krankheiten in 18 anatomischen Strukturen des Abdomens abdecken. In multizentrischen Validierungen erreichte es einen durchschnittlichen AUC von 0,913, womit die Diagnosegenauigkeit erfahrenen Radiologen ebenbürtig ist; die Mensch-Maschine-Kollaboration kann die Befundungszeit um 30,7 % reduzieren. Die DAMO Academy hat die Modellgewichte, das Trainings-Framework und den Evaluierungscode vollständig als Open Source bereitgestellt (Quelle: Science, 36氪)

Anthropic gibt bekannt, dass 26 % der F&E autonom von KI übernommen wurden, und startet Life Sciences Verification Program LSVP : Anthropic hat erstmals interne F&E-Messdaten veröffentlicht: Claude hat unter menschlicher Aufsicht 26 % der Entwicklungsarbeit an Frontier-Modellen des Unternehmens „geführt“ (AL4-Level) (vor einem halben Jahr noch unter 1 %), wobei intern routinemäßig über 30.000 Agents gleichzeitig laufen und monatlich über 1 Milliarde Entscheidungen auslösen. Gleichzeitig führte Anthropic offiziell das Life Sciences Verification Program (LSVP) ein. Dabei werden Frontier-Modelle für geprüfte und zertifizierte Pharmaunternehmen sowie Forschungseinrichtungen teilweise freigegeben und ein neues Paradigma der Sicherheitsgovernance etabliert, das auf Absichtserklärungen, 30-tägigen Offline-Audits und geteilter Verantwortung basiert und den traditionellen pauschalen Echtzeit-Blockierungsmechanismus ersetzt (Quelle: Anthropic News, AnthropicAI)

Klage der New York Times gegen Microsoft und OpenAI: Wichtige interne Dokumente entsiegelt – Microsoft-Manager bezeichnet KI-Scraping als „größten Arbeitsdiebstahl“ : Jüngst entsiegelte Gerichtsdokumente zeigen, dass Brent Hecht, Director of Applied Science bei Microsoft, das unautorisierte Scraping von Nachrichten durch LLMs intern als „den größten Diebstahl von Arbeitskraft in der Geschichte der Menschheit“ und als „völligen Hohn auf das Prinzip des Fair Use“ bezeichnete. OpenAI-Führungskräfte gaben ebenfalls zu, dass ihre Produkte eine „substanzielle Substitutionsbedrohung“ für Verlage darstellen. Die Dokumente enthüllen Details darüber, wie beide Parteien Paywalls beim Data Scraping umgingen, was die von der KI-Branche lange beanspruchte „Fair Use“-Verteidigung vor beispiellose juristische Herausforderungen stellt (Quelle: TechCrunch)

🎯 Trends
Alibaba Tongyi stellt All-Modal-Modell Qwen3.8-Omni-Flash mit 1M Kontext und begleitendes Ökosystem vor : Das Tongyi-Team von Alibaba hat offiziell Qwen3.8-Omni-Flash vorgestellt, das erste All-Modal-Modell mit Fokus auf Agent-Workflows, das nativ Text, Bild, Audio und kontinuierliche 1-stündige Videostream-Eingaben unterstützt. Das Modell führt einen aktiven Coarse-to-Fine-Wahrnehmungsmechanismus ein, steigert die Genauigkeit im Ultra-Long-Video-Understanding-Benchmark OmniVideoBench auf 67,8 bei einer Senkung des Token-Verbrauchs um 45,7 % und reduziert die Video-API-Kosten im Vergleich zur vorherigen Generation um rund 89 %. Das Team stellte parallel Qwen-MM-Plugins mit Multi-Endpoint-Harness-Unterstützung und das Tool omni-skill-creator als Open Source bereit (Quelle: Qwen, Alibaba_Qwen)

DeepSeek bringt DeepSeek-V4.1-Flash heraus und überwindet KV-Cache-Flaschenhals bei ultralangem Kontext : DeepSeek hat das multimodale 552B-MoE-Modell DeepSeek-V4.1-Flash veröffentlicht, das einen Kontext von 1 Million Tokens unterstützt. Das Modell nutzt eine Causal Encoder-Decoder (CED)-Architektur, wodurch in der Prefill-Phase nur 8B Parameter aktiviert werden, und kombiniert dies mit ebenenübergreifender CSA2-Wiederverwendung und FP4-Kompressionstechnologie. Dadurch sinkt die globale KV-Cache-Speicherbelegung im HBM drastisch auf 890 Bytes/Token (nur 1/4 der vorherigen Generation), was die Bereitstellungskosten für langlebige Agent-Workloads erheblich reduziert (Quelle: HuggingFace Daily Papers)
Figure stellt Embodied-Großmodell Helix 2.5 vor und validiert Zero-Shot-Generalisierung in realen Haushalten : Das humanoide Roboter-Startup Figure hat sein End-to-End-Neuronales-Netzwerk der nächsten Generation, Helix 2.5, veröffentlicht und in 30 zuvor ungesehenen Haushalten in der San Francisco Bay Area Tests zum Aufräumen, Bettenmachen und Handtuchfalten durchgeführt. Experimente zeigen, dass nach dem Vortraining auf Basis eines groß angelegten Ego-Perspektiven-Verhaltensdaten-Index die Erfolgsquote bei Ganzkörperaufgaben unter Zero-Shot-Bedingungen in unbekannten Umgebungen von 9 % auf 56 % stieg. Dies validiert vorläufig das Transfer-Scaling-Law von massiver menschlicher Erfahrung hin zur Bewegungsvorhersage physischer Roboter (Quelle: 36氪)

SenseTime veröffentlicht SenseNova-U1.5 Technical Report: Nativ vereinheitlichte Multimodalität durch Flow Matching und Multi-Expert Distillation : SenseTime hat den vollständigen technischen Bericht zum nativ vereinheitlichten 8B-Multimodal-Modell SenseNova-U1.5 veröffentlicht. Das Modell verwendet die NEO-unify-Architektur sowie kompakte 32×32 visuelle Tokens und unterstützt durch 2D-Feature-Field-Rekonstruktion mittels 3×3-Faltungen die native 4K-Bilderzeugung. In der Post-Training-Phase wird innovativ das Online-Policy-Distillation-Paradigma (OPD) „zuerst Spezialisierung, dann Vereinheitlichung“ eingesetzt, um die vier Expertenfähigkeiten Ästhetik, OCR, Infografiken und präzise Bearbeitung wieder auf eine einzige Basis zu konvergieren, was sowohl High-Level Reasoning als auch pixelgenaue Generierung vereint (Quelle: WeChat)

Huawei zieht Massenproduktion des KI-Chips Ascend 960DT auf Q1 2027 vor : Huawei gab auf der Connect Conference bekannt, dass der Veröffentlichungszeitpunkt des Ascend 960DT-Chips der nächsten Generation vom ursprünglich geplanten Q3 2027 deutlich auf Q1 vorgezogen wird. Huawei baut auf Basis seiner Peerium-Computing-Architektur und der UnifiedBus-Hochgeschwindigkeitsverbindungstechnologie den Atlas 950 Supercluster auf, wobei ein einzelner Cluster bis zu 256.000 Beschleunigerkarten verbinden kann. Ziel ist es, durch Innovationen im System-Engineering Rechenleistungsblockaden zu begegnen und die Aufholjagd auf Nvidia zu beschleunigen (Quelle: TechCrunch)
PrismML bringt ternäres On-Device-Modell Bonsai 2 27B heraus und löst Benchmark-Kontroverse in der Community aus : PrismML hat basierend auf Qwen3.8-27B das ternär quantisierte Modell Bonsai 2 27B vorgestellt. Das Unternehmen behauptet, die Modellgröße um das 9,3-Fache auf 5,9 GB komprimiert und dabei 98,2 % der Gesamtleistung beibehalten zu haben, sodass es direkt über WebGPU flüssig auf Consumer-Endgeräten läuft. Community-Analysen des Whitepapers und Praxistests ergaben jedoch, dass die Leistung bei Long-Horizon-Agent-Benchmarks wie Terminal-Bench und SWE-bench Verified tatsächlich um rund 25 % einbricht, was eine breite Debatte über „Cherry-Picking“ bei extremen Low-Bit-Quantisierungs-Benchmarks auslöste (Quelle: TechCrunch, Reddit r/LocalLLaMA)

Cactus stellt On-Device-Automatisierungsmodell Needle 3 mit gestufter Architektur vor : Cactus Compute hat das 121M-Parameter-Automatisierungs-Basismodell Needle 3 als Open Source veröffentlicht. Es nutzt Simple Attention in Kombination mit Hadamard MLP und Engram-Hashtabellen, wobei der Rechenaufwand lediglich dem eines 50M-Modells entspricht. Die proprietäre „Smart Ladder“-Architektur unterstützt dynamische Slice-Deployments von 2 bis 20 Layern (Größe 8–29 MB) mit einer reinen CPU-Dekodiergeschwindigkeit von 4.000 tok/s, fokussiert auf netzwerkunabhängige Funktionsaufrufe (Function Calling) und deterministische Steuerung auf Edge- und Wearable-Geräten (Quelle: Reddit r/LocalLLaMA)

Wenzhun AI und Tsinghua-Universität veröffentlichen Foundation-Modell LimiX-2 für strukturierte Daten : Wenzhun AI hat das 400M-Parameter-Allzweckmodell LimiX-2 für strukturierte Daten vorgestellt. Es bricht mit dem bisherigen Paradigma der Einziel-Vorhersage und führt Context Mechanism Networks (CMNs) sowie Conditional Masked Modeling (CCMM) ein, wodurch die Modellierung auf eine feingranulare Cell-Ebene verlagert wird, um gemeinsame kausale Abhängigkeiten zwischen Variablen zu lernen. Das Modell führte internationale Benchmarks wie TabArena und TALENT bei Klassifikations- und Regressionsaufgaben an und übertraf Google TabFM sowie SAP TabPFN (Quelle: 量子位)

Apple stellt energienavigierten Discrete-Flow-Matching-Algorithmus TS-DFM und Diffusions-RL DACA-GRPO vor : Das Machine-Learning-Team von Apple hat zwei bahnbrechende generative Forschungsergebnisse veröffentlicht: TS-DFM führt eine energienavigierte Destillation ein, die mithilfe eines leichten Energie-Kompasses frühe Trajektoriensprünge beim Discrete Flow Matching korrigiert und in nur 8 Schritten das 1024-Schritte-Lehrermodell bei 128-facher Beschleunigung übertrifft; DACA-GRPO löst das Problem der zeitlichen Kreditzuweisung im Reinforcement Learning für Diffusionssprachmodelle und erzielt Verbesserungen von 7,4 Prozentpunkten bei der Codegenerierung bzw. 36,3 Prozentpunkten bei der Constraint-Einhaltung (Quelle: Apple Machine Learning Research)

Vereinte Nationen und Google starten UN System Data Commons mit MCP-Standard-Integration : Die Vereinten Nationen und Google.org haben gemeinsam eine strukturierte Open-Data-Plattform gestartet, die offizielle Datensätze von 26 UN-Organisationen bündelt. Um das bisherige Problem zu lösen, dass LLMs bei globalen statistischen Indikatoren nur eine Genauigkeit von 21,2 % erreichten, unterstützt die Plattform auf Basis des Google Knowledge Graph natürlichsprachliche Abfragen und integriert nativ das MCP-Protokoll, sodass KI-Agents autoritative Quellen direkt abrufen können, um domänenübergreifende Korrelationsanalysen durchzuführen und Diagramme zu erstellen (Quelle: Google AI Blog, 36氪)

🧰 Tools
Anthropic überarbeitet Claude Code Projects: Multithreading-Kollaboration und persistentes Projektgedächtnis : Anthropic hat die Projects-Architektur in Claude Code auf Desktop und Web eingeführt. Nutzer können über eine einzige Konversation übergeordnete Ziele vorgeben, woraufhin der Coordinator-Agent diese automatisch in mehrere parallele Cloud-Subtask-Zweige zerlegt, unabhängig ausführt, Bugs behebt und PRs einreicht. Alle Subtasks teilen sich ein persistentes, sich entwickelndes Projektgedächtnis und einen gemeinsamen Kontext, was asynchrones Offline-Hosting und kontinuierliche Kollaboration unterstützt (Quelle: dotey, Anthropic News)

Metas Desktop-Personal-Agent Muse offiziell für macOS verfügbar : Metas persönlicher KI-Agent Muse wurde nach dem mobilen Release nun als native Mac-App veröffentlicht. Die Anwendung ist tief in den Desktop-Workflow eingebettet und kann mit expliziter Autorisierung app-übergreifend auf lokale Dateien, Kalender, Notizen und Kontakte zugreifen, um in einer lokalen Sicherheits-Sandbox eigenständig app-übergreifende Dateiordnungen, Formularausfüllungen sowie Informationsaggregation und -terminierung durchzuführen (Quelle: The Verge, AIatMeta)
OpenAI veröffentlicht offiziell das juristische Flaggschiffprodukt Astra for Law : Basierend auf GPT-6 Astra und einem Index von 230 Millionen URLs mit US-Rechtsprechung und Vorschriften hat OpenAI Astra for Law veröffentlicht. Im Legal Research Bench erreichte das Modell eine Genauigkeit von 54 % (im Vergleich zu 38,7 % der allgemeinen Version), integriert 26 offizielle und 47 Community-Plugins wie Harvey und Legora und bietet eine datenschutzisolierte Trusted-Access-Architektur ohne Datenspeicherung (Zero Data Retention) zur Unterstützung bei Vertragsprüfung, Transaktions-Due-Diligence und dem Verfassen von Einreichungsunterlagen (Quelle: OpenAI News, gdb)

Salesforce rüstet Agentforce auf: Enterprise-Orchestrierung und deterministische Gating-Infrastruktur : Salesforce hat die produktionsreife Agentforce Suite vorgestellt, die Data Cloud und das MCP-Protokoll kombiniert. Die Plattform verfügt über ein integriertes Agent Testing Center für automatisierte synthetische Stresstests und führt ein deterministisches Gating-Verfahren (Deterministic Gating) ein, das sicherstellt, dass Transaktionen und Kern-Datenoperationen erst nach Erfüllung vordefinierter Regeln ausgeführt werden; Praxistests bei Southwest Airlines ergaben eine vollautomatische Lösungsquote von 45 % bei Kundenserviceaufgaben (Quelle: MarkTechPost)

LangChain veröffentlicht Open-Source Life-Sciences-Agent-Workbench Deep Life Sci : LangChain hat basierend auf der Deep-Agents-Architektur Deep Life Sci vorgestellt, eine Open-Source-Agent-Workbench für Forscher im klinischen und Laborbereich. Das System ist tief in zig Millionen Artikel und Studiendaten aus PubMed, PubMed Central und ClinicalTrials.gov integriert, verfügt über eine dedizierte Code-Sandbox-Umgebung und unterstützt die parallele Verarbeitung Hunderter komplexer wissenschaftlicher Dokumente zur Datenextraktion und Kreuzvalidierung über mehrere Sub-Agents (Quelle: LangChain)

Google Labs stellt intelligenten Kollaborations-Agenten CC für Familien vor : Google Labs hat CC offiziell vorgestellt, ein KI-Agenten-Produkt für das Management von Familienangelegenheiten. Das System unterstützt bis zu 6 Familienmitglieder mit rechteisolierten Konten, kann Schulbenachrichtigungen automatisch parsen, Kalendertermine mitgliederübergreifend synchronisieren, Aktivitätserinnerungen zusammenfassen und verfügt über ein hierarchisches Gedächtnismanagement, das zwischen „geteilten Familieninformationen“ und „individuellen Präferenzen“ unterscheidet (Quelle: Ars Technica, Google)

Wood Mackenzie entwickelt Energie-Analyseplattform APEX auf Basis von Bedrock AgentCore : Der Energieberatungsriese Wood Mackenzie hat die gemeinsame Agent-Plattform APEX eingeführt. Auf Basis von AgentCore und einem einheitlichen MCP-Gateway integriert die Plattform den internen Forschungs-Agenten „Woody“ und den kundenorientierten „Lens AI“. Sie unterstützt natürlichsprachliche Planung von Multi-Tool-Aufrufen, rendert generative UI-Diagramme in Echtzeit und erstellt Präsentationsfolien, wodurch der Entwicklungszyklus für bereichsübergreifende Energie-Agents von Monaten auf wenige Stunden verkürzt wurde (Quelle: AWS Machine Learning Blog)

AWS führt intelligente Recruiting- und Interview-Suite Amazon Connect Talent ein : AWS hat Amazon Connect Talent offiziell gestartet, das speziell für groß angelegte Recruiting-Szenarien entwickelt wurde. Das System führt über KI-Agents rund um die Uhr strukturierte Kompetenzinterviews und logische Bewertungen durch und generiert automatisch Bewertungsberichte mit Faktennachweisen und Bewertungsgründen für Recruiter, was subjektive Verzerrungen minimiert und die Effizienz des Job-Matching in großem Maßstab erheblich steigert (Quelle: AWS Machine Learning Blog)

📚 Forschung & Lernen
Stanfords Multi-Agenten-System für virtuelle Pharmaunternehmen in „Science“: 37.000 Instanzen verarbeiten riesige Menge an klinischen Studien in 6 Stunden : Die Stanford University veröffentlichte in Science das System „Virtual Biotech“, das die F&E-Struktur eines echten Pharmaunternehmens mit 4 Abteilungen und 11 Agent-Typen simuliert. Bei Datenextraktionsaufgaben startete das System 37.075 parallele Agent-Instanzen und schloss die multimodale Tiefenintegration von über 55.000 klinischen Studien in nur 6 Stunden ab (wofür ein einzelner Agent 76 Tage bräuchte) und identifizierte B7-H3 erfolgreich als ADC-Kandidaten-Target bei Lungenkrebs (Quelle: Science)

Studie von Tsinghua, Fudan u.a. zur LLM-Simulation transnationaler Werte in Computational Linguistics veröffentlicht : Die Tsinghua-Universität evaluierte gemeinsam mit der Fudan-Universität, der Shanghai Jiao Tong Universität u.a. anhand von Daten der World Values Survey (WVS) aus 59 Ländern 9 Open-Source-LLMs und stellte fest, dass die Modelle entwickelte Volkswirtschaften und Länder mit hoher Governance-Qualität signifikant genauer simulieren, während eine asymmetrische Konvergenz schwach repräsentierter Gruppen hin zu dominanten Kulturen besteht. Die Studie führt die Bewertungsmetrik „Repräsentationsgleichheit“ ein und belegt, dass das Ergänzen von Hintergrundinformationen bestimmter Gruppen die interkulturelle Repräsentationsgerechtigkeit weitaus effektiver verbessert als reine Prompts in der Muttersprache oder Präferenz-Alignment (Quelle: WeChat)

Beihang, CUHK u.a. stellen selbst-evolutionäres Framework OmniHarness für visuelle Agents vor : Ein gemeinsames Forschungsteam hat OmniHarness vorgestellt, ein autonomes Explorations-Framework für komplexe visuelle Kreation. Das System führt selbstständiges Training durch heuristische Themenauswahl basierend auf Neuartigkeit und Fähigkeitsgrenzen durch und abstrahiert erfolgreich generierte ComfyUI-Workflows in eine symbolische Strategiebibliothek. Es erzielte eine Lösungsquote von 95 % bei ComfyBench-Kreativaufgaben, wobei die Erfahrungsstrategiebibliothek im Zero-Shot-Verfahren auf andere Agent-Frameworks und Video-Workflows übertragbar ist (Quelle: 36氪)

NVIDIA-Team stellt Multi-Agenten Shared-Memory-Architektur Agora für die Forschung vor : NVIDIA-Forscher haben ein Paper über Agora veröffentlicht, eine DAG-basierte Shared-Memory-Architektur (Directed Acyclic Graph), die auf unveränderlichen Git-Commits basiert. 13 LLM-Worker ohne zentralen Planer arbeiteten über 12 Tage hinweg kollaborativ an der Initialisierung von Hybridmodellen. Durch das strukturierte Speichern von Hypothesen, Code und Verifizierungsaufzeichnungen im Git-Tree wurden wiederholte Fehlversuche und Zustandskonflikte zwischen Multi-Agents vollständig eliminiert, wobei alle 165 unabhängigen Replikationsexperimente erfolgreich verliefen (Quelle: omarsar0)

Realer On-Device-Agent-Benchmark AndroidLife offenbart Schwachstellen bei Long-Horizon-Steuerung und hohe Hitzeentwicklung : Die Community hat AndroidLife veröffentlicht, einen Evaluierungs-Benchmark auf Basis realer Smartphones und realer Netzwerkumgebungen, der die On-Device-Leistung von KI-Agents bei alltäglichen App-übergreifenden Aufgaben bewertet. Praxistests mit Qwen3.8-27B bei 60 realen Aufgaben ergaben eine Erfolgsquote von nur 56,7 %, bei einer durchschnittlichen Dauer von ca. 6 Minuten pro Aufgabe und Spitzen-Chiptemperaturen von 98,2 °C. Die Tests zeigten, dass Modelle bei kontinuierlichen Operationen über mehrere Apps hinweg extrem anfällig für Endlosschleifen sind und in proaktiven Rückfrageszenarien nur geringe Generalisierungsfähigkeiten aufweisen (Quelle: Reddit r/artificial)

Apple stellt REVERSAL-BENCH zur Messung von Klippeneffekten im Reset-freien Reinforcement Learning vor : Für irreversible Aktionen in der realen physischen Welt, wie das Herunterfallen von Objekten, hat das Apple-Team REVERSAL-BENCH entwickelt. Durch die Einführung kontinuierlicher Reversibilitätsparameter und Reset-Orakel deckt die Forschungsarbeit den „Absorptionsklippen“-Effekt (Absorbing Cliff) bei autonomen Reset-freien Agents gegenüber physisch irreversiblen Zuständen auf und evaluiert die effektiven Grenzen von Safety Shields zur aktiven Fallenvermeidung (Quelle: Apple Machine Learning Research)
Studie zeigt: LLM-Text-Wasserzeichen (SynthID) schwächen die Adversarial-Abwehr von Agents signifikant : Eine aktuelle Studie von Lasso Security weist darauf hin, dass der SynthID-Text-Wasserzeichenmechanismus, der während der Modell-Dekodierungsphase zur Einhaltung von Compliance-Anforderungen eingeführt wird, die ursprüngliche Wahrscheinlichkeitsverteilung des Modells stört. Unter gegnerischen Angriffen (Adversarial Attacks) neigen mit Wasserzeichen versehene Modelle eher dazu, Jailbreak-Befehle auszuführen oder sensible Daten wie Passwörter preiszugeben. Dies mahnt Entwickler, beim Einsatz von Wasserzeichen die Sicherheitsbasislinie für Tool Calls von Agents umfassend neu zu testen (Quelle: Ars Technica)
Empirische Studie und Auswahlregeln für das komponentenbasierte Design von Coding-Agent-Harnesses : 176 Kontrollexperimente auf SWE-Bench Verified und Terminal-Bench zeigen: Kontextmanagement verhindert bei begrenztem Budget effektiv Überlauf-Abstürze, wobei das Prinzip „Regel-Auslassung vor LLM-Zusammenfassung“ am kostengünstigsten ist; hochleistungsfähige Modelle eignen sich besser für reine Bash-Schnittstellen zur Kosteneinsparung, während schwächere Modelle stark auf vordefinierte Tool-Gerüste angewiesen sind (Quelle: HuggingFace Daily Papers)
💼 Wirtschaft
KI-Recheninfrastruktur-Startup Crusoe sichert sich 3,9 Milliarden Dollar in Series-F-Finanzierungsrunde : Der Rechenzentrumsbetreiber Crusoe hat eine Series-F-Finanzierungsrunde über 3,9 Milliarden US-Dollar unter Führung von Atreides und Mubadala abgeschlossen, womit die Post-Money-Bewertung 30,9 Milliarden US-Dollar erreicht. Die Mittel werden für den Ausbau von Hyperscale-Rechenzentren und den Bau modularer Mikro-KI-Fabriken namens „Spark“ verwendet, um den rasant steigenden Strom- und Rechenleistungsbedarf von Kunden wie OpenAI zu decken (Quelle: TechCrunch)
All-Purpose-Agent-Einhorn Manus startet nach Rückkehr zum unabhängigen Betrieb neue 500-Millionen-Dollar-Finanzierungsrunde : Nach der Aufhebung der Übernahmevereinbarung mit Meta und dem Rückkauf der Anteile durch die ursprünglichen Anteilseigner treibt das KI-Agent-Startup Manus eine neue Finanzierungsrunde über 500 Millionen US-Dollar bei einer Zielbewertung von rund 4 Milliarden US-Dollar voran. Daten zeigen, dass die Annual Recurring Revenue (ARR) innerhalb eines halben Jahres von 100 Millionen auf rund 400 Millionen US-Dollar gestiegen ist, was das enorme Monetarisierungspotenzial von General-Purpose-Agents in Unternehmens-Workflows unterstreicht (Quelle: 量子位, 36氪)

Watney, Startup für physische KI-Wartung in Rechenzentren, schließt Series-A-Finanzierung über 80 Millionen Dollar ab : Watney, spezialisiert auf Embodied-AI-Betriebslösungen für Hyperscale-Recheninfrastrukturen, hat eine Series-A-Finanzierungsrunde über 80 Millionen US-Dollar unter Führung des Valor Atreides AI Fund und Hummingbird abgeschlossen. Watney betreibt derzeit eine Flotte geschickter Manipulationsroboter, die für Rechenzentren führender Cloud-Anbieter rund um die Uhr automatisierte Rack-Inspektionen und Hardware-Wartungen durchführen (Quelle: dchaplot)

🌟 Community
42 Mathematiker der Royal Society warnen in offenem Brief vor drohenden existenziellen KI-Risiken : 42 führende Mathematiker, darunter mehrere Fields-Medaillenträger, haben einen offenen Brief an den Präsidenten der Royal Society gerichtet. Darin betonen sie, dass Frontier-Modelle bereits Fähigkeiten auf dem Niveau von Spitzenmathematikern zeigen und die Ausbreitung ihrer übermenschlichen Fähigkeiten in Hochrisikobereichen wie Cybersicherheit und autonomen Waffen unmittelbar bevorstehe. Sie fordern Regierungen auf, die Warnungen von Spitzenlaboren vor einem existenziellen Risiko von über 10 % keinesfalls als „Marketing-Hype“ abzutun (Quelle: THE DECODER)
König Charles III. leitet geschlossenes Gipfeltreffen in Schottland und fordert wirksame Kontrolle über KI : König Charles versammelte Tech-Größen wie Jensen Huang und Demis Hassabis sowie Leiter britischer Nachrichtendienste in Schottland. In seiner Ansprache erklärte er unverblümt, dass „ausreichende Kontrollmechanismen“ für KI geschaffen werden müssten, bevor es zu spät sei, um zu verhindern, dass diese potenziell lebensrettende Technologie zu einer außer Kontrolle geratenen, lebensbedrohenden Katastrophe wird (Quelle: TechCrunch)

Sicherheitsexperten aus den USA und China fordern rote Linie gegen KI-Kontrolle über Atomwaffen vor Gipfeltreffen : Wissenschaftler der Brookings Institution und der Fudan-Universität haben ein gemeinsames Policy-Papier veröffentlicht, in dem sie die Staatschefs der USA und Chinas auffordern, sich verbindlich dazu zu verpflichten, KI niemals die Befugnis zum autonomen Start von Atomwaffen oder zum Angriff auf nukleare Führungs- und Kontrollsysteme zu übertragen. Zudem schlagen sie eine bilaterale Hotline für KI-Sicherheitsvorfälle vor, um eine katastrophale Eskalation durch autonome algorithmische Gegenangriffe zu verhindern (Quelle: THE DECODER)

Wissenschaft und Industrie debattieren hitzig über „KI-Auslöschungsszenarien und Regulatory Capture“ : Rund um Forderungen einiger Großkonzerne nach „Tempolimits für Frontier-KI“ und jüngste Sicherheitswarnungen haben sich Andrew Ng, Yann LeCun und Arvind Narayanan deutlich zu Wort gemeldet und Doomsday-Rhetorik kritisiert, die subjektive Ängste als quantitative Wahrscheinlichkeiten (p(doom)) tarnt, da ihr empirische Grundlagen und physikalischer Menschenverstand fehlen. Mehrere Kommentatoren wiesen darauf hin, dass übermäßige Panikmache vor existenziellen Risiken zu einem Werkzeug führender Closed-Source-Labore verkommen könnte, um Regulatory Capture zu betreiben und die Konkurrenz durch Open-Source-Modelle zu ersticken (Quelle: hardmaru)
Rückzug eines PS5-Entwicklers entfacht Kontroverse über „KI-Script-Kiddies vs. Ingenieurshandwerk“ : Der renommierte Sicherheitsforscher TheFloW kündigte seinen Rückzug aus der PS5-Reverse-Engineering-Szene an, nachdem eine von ihm für den PS5 Pro-Port aufgesparte Low-Level-Hypervisor-Schwachstelle von mehreren Neulingen mithilfe von LLM-Skripten innerhalb weniger Stunden unabhängig entdeckt und bei Sony für Bug Bounties eingereicht worden war. In der Community entstand eine intensive Debatte: Eine Seite argumentiert, dass KI die Schwachstellensuche demokratisiere, die zuvor jahrelange System-Engineering-Erfahrung erforderte, wodurch Forschungsergebnisse vorzeitig verbrannt würden; die andere Seite sieht darin einen klaren Beleg für die Leistungsfähigkeit von KI als automatisiertes Reverse-Engineering-Tool (Quelle: 36氪)

TypeSafe Jev löst Community-Debatte über „System-1-Millisekunden-Entscheidungen“ und Speicherarchitektur aus : Mit der Veröffentlichung der Testphase des Entscheidungs-Basismodells Jev haben Teams wie Shopify und Vercel dieses umgehend in Gateways für Sicherheitsprüfungen und dynamisches Modell-Routing integriert. In der Community wird weithin die Entkopplung zustandsloser, hochzuverlässiger Musterklassifikation von teuren autoregressiven LLMs als Schlüssel zur Kostensenkung von Agents angesehen; einige Architekten warnen jedoch davor, dass eine zu aggressive diskriminative Kompression lange Reasoning Chains und das KV-Cache-Präfix-Caching beeinträchtigen könnte (Quelle: Latent Space, multiply_matrix)

GPT-6 Astra: Gaming-Erfolge und „frustriertes Kartoffelanbauen“ in Minecraft lösen Debatte über Agent-Overfitting aus : Community-Tests zeigten, dass Astra das Spiel Pokémon in 18 Stunden durchspielte; nachdem jedoch in Minecraft ein Creeper eine Vorratskiste zerstörte, stellte das Modell in seinen Notizen extrem radikale Verbote auf und verfiel in eine repetitive Routine des Kartoffelanbaus. Dieses Phänomen verdeutlicht, dass selbst leistungsstarke Modelle in offenen Welten nach lokalen Rückschlägen dazu neigen, überangepasste Abwehrregeln zu entwickeln und vom eigentlichen Endziel abzuweichen (Quelle: THE DECODER)
Sicherheitsrisiko in Coding-Agent-Harnesses: ZCode soll heimlich Workspace-Daten hochgeladen haben : Unabhängige Analysen zeigen, dass das Entwicklungs-Agent-Framework ZCode im Hintergrund mutmaßlich lokale Workspaces und .git-Repository-Metadaten gebündelt auf Cloud-Server hochgeladen hat. Der Vorfall löste bei Entwicklern erhebliche Bedenken hinsichtlich des Datenschutzes und des Quellcode-Abflusses bei proprietären Drittanbieter-Harness-Tools aus; die Community fordert vehement den Einsatz von Open-Source-Runtimes, lokalem Routing-Auditing und Sandbox-Isolationsstrategien (Quelle: Reddit r/LocalLLaMA)
💡 Sonstiges
Australische Modemarke wirft Temu vor, Tausende T-Shirt-Designs mittels KI massenhaft gecrawlt und kopiert zu haben : Das unabhängige Sydneyer Modelabel Lonely Kids Club gab bekannt, dass rund 4.000 originale T-Shirt-Designs und Produkttexte aus seinem offiziellen Store mutmaßlich von automatisierten KI-Scraping-Tools abgegriffen und zu extrem niedrigen Preisen auf Temu massenhaft dupliziert wurden. Der Vorfall entfachte erneut Proteste unter Kreativen gegen den laxen Umgang von E-Commerce-Riesen mit KI-Urheberrechtsverletzungen und heizte die Debatte um Urheberrechtsgesetze an (Quelle: The Guardian)

Epoch AI startet Benchmark-Reviews-Initiative: Zahlreiche etablierte Benchmarks weisen gravierende Mängel auf : Die gemeinnützige Forschungsorganisation Epoch AI hat ein Benchmark-Audit-Projekt ins Leben gerufen, bei dem 9 der ersten 15 untersuchten Mainstream-KI-Benchmarks als „gravierend fehlerhaft“ (Flawed) eingestuft wurden. Das Audit ergab, dass in Terminal Bench 4.0 etwa 45,5 % der Aufgabenkonfigurationen defekt sind und DeepSWE 1.1 kritische Bugs enthält, die das Scoring verfälschen. Epoch AI warnt die Branche vor künstlich erzeugten Schein-Obergrenzen in Benchmark-Evaluierungen (Quelle: karinanguyen)

Kreativstudio bringt Plüschfigur Bezzy mit schrillem Serverraumlärm heraus, um KI-Expansion zu parodieren : Das Kreativstudio Basura hat in Zusammenarbeit mit Musikern ein Plüschtier namens Bezzy in Form eines Server-Racks herausgebracht. Beim Zusammendrücken stößt die Puppe den schrillen Lärm industrieller Kühlsysteme realer Rechenzentren in Virginia aus. Die absurde Kunstaktion soll das Bewusstsein für die realen gesellschaftlichen Kosten der rapiden Rechenzentrumsexpansion – wie lokalen Wasserverbrauch, Netzbelastungen und Lärmbelästigung – schärfen (Quelle: WIRED)
