Fei-Fei Lis World Labs veröffentlicht Atlas… | KI-Tagesbericht 2026-09-03

🔥 Fokus

Anthropic veröffentlicht Claude Fable 5.1 / Mythos 5.1: starker Anstieg bei Forschungs-Coding, Cache-Lese preis um 75 % gesenkt, plus Anti-Destillation, Wasserzeichen und Zero-Retention für Unternehmen : Beide teilen die Basis, die Sicherheitsstrategien gabeln sich. Fable landet noch heute in API/Bedrock/Azure u. a.; Mythos nur für geprüfte Cybersecurity- und Life-Science-Institutionen. Terminal-Bench-Science 0.1 erreicht 52,6 % (Vorgänger ca. 24,7 %), Terminal-Bench 4.0 ca. 55,8 %/Mythos ca. 60,9 %, CursorBench ca. 73,4 %. Input/Output bleiben $10/$50 pro Million Token, Cache-Reads fallen von $1 auf $0,25; offiziell typische Lasten ca. −25 %, schwere Agent-Lasten bis ca. 45 %. Neue API-Konten können Prefixes nicht mehr ändern und zugleich die Chain of Thought behalten; Text enthält SynthID-artige Wasserzeichen, die Detection-API geht zuerst an Aufsicht und Medien. Auf Unternehmensseite parallel Frontier Safeguards (EFS): Missbrauchs-Monitoring-Logs in kundeneigenes S3/Blob/GCS, automatische Alerts vom Kunden geprüft; Bedrock stuft es als Covered Model ein, Standard-Aufbewahrung max. 30 Tage und AWS-Review möglich; berechtigte Unternehmen können EFS nutzen und interne Nutzung von Fable 5/5.1 nahe Zero-Retention. Artificial Analysis: volle Output-Token ca. 1,7× mehr, manche Tasks nicht unbedingt günstiger; Community meckert über Quotas, Fehlblockaden durch Militär-Metaphern und „Release-then-dumber“. (Quelle: AnthropicAnthropic NewsAWSTHE DECODERVentureBeat)

Claude Fable 5.1

Fei-Fei Lis World Labs veröffentlicht Atlas: Few-Shot-3D-Rekonstruktion, pixelgenaue Kamerasteuerung und Robotik Real-to-Sim : Von Grund auf trainierter multimodaler autoregressiver Diffusions-Transformer, der Text/Bild/Video/Pose/Tiefe in denselben räumlichen Kontext verankert; Ausgabe bis ca. 1 Minute 1440p, Punktwolken und Gaussian Splatting. Offiziell: kameragesteuerte Generierung vs. Text-Kamerafahrt-Videomodelle menschliche Präferenz ca. 75 %–94 %, Sparse-Rekonstruktion AbsRel besser als mehrere Open-Source-Spezialmodelle; Demos: Bullet Time aus Handy-Material, RGB-D-Synthese für Roboter. Derzeit Early Access für Partner, wird Unterbau für Marble u. a. Community: eher „Set bauen“ als lange Physik-Vorhersage, lange Pfade mit geometrischem Drift. (Quelle: World LabsTHE DECODER机器之心)

World Labs Atlas

Gemini startet Agentic Video Understanding: Frames on demand, Token bis ca. −88 %, Kosten ca. −66 % : 3.7/3.6 Flash und 3.5 Flash-Lite entscheiden dynamisch, welchen Abschnitt und welchen Kanal (Frame/Audio/Untertitel) sie nutzen, statt fest 1 FPS den ganzen Clip. Google: bessere Long-Video-Retrieval, Sub-Second-Schnitte, Anomalie-Nachprüfung und Zählen, Benchmark-Genauigkeit ca. +7 %; unter 2 Minuten weiter static empfohlen. API: processing=agentic, keine Extra-Feature-Gebühr; folgt in Gemini App und YouTube „Ask YouTube“. (Quelle: Google DeepMindTHE DECODER)

Agentic video

OpenAI: Astra erreicht Preparedness-Schwelle „kritische Cybersecurity“; öffentliche Version wird fortgeschrittene Hacker-Fähigkeiten kappen : Offiziell erstes Modell mit Cyber-Critical: mit Tools autonome Entdeckung und Ausnutzung unbekannter Schwachstellen, ExploitBench intern voll, in Umbau-Tests auch Zero-Days. Öffentliche Version begrenzt fortgeschrittene Netzfähigkeiten; Daybreak-Partner (Cisco, Cloudflare, Palo Alto u. a.) zuerst lockerere Version; dazu Mismatch-Monitoring, Jailbreak-Resistenz und CoT-Überwachung. The Information: evtl. zyklische Tiefe/Looped Transformer, Streit um CoT-Überwachbarkeit; Jakub Pachocki: Rechengraph-Tiefe weiter innerhalb des Doppelten von GPT-4, begrenzte Loop-Anzahl. Firma unterstützt Kaliforniens SB 1119 Jugend-AI-Sicherheitsgesetz. Branche: „sicher genug zum Freigeben“ ohne Drittprüfung. (Quelle: OpenAIWIREDTechCrunch)

Tumbler-Ridge-Schulschießerei: 30 weitere Klagen, erstmals OpenAI wegen „Beihilfe und Anstiftung“ : Kanzlei Edelson klagt erneut für anwesende, nicht getroffene Lehrkräfte und Schüler, insgesamt ca. 37; neue Klageschrift hebt von Fahrlässigkeit auf Beihilfe. Kläger: Sicherheitsteam markierte das Konto schon ca. 8 Monate zuvor als glaubwürdige Schusswaffen-Bedrohung, nach Sperre schnell neue Konten; Global Affairs Officer Chris Lehane soll angeordnet haben, die Polizei nicht zu rufen; Firma bestreitet seine Beteiligung. Der Fall rückt „wann die Polizei rufen“ ins Zentrum von Produkt und Governance. (Quelle: TechCrunchThe Guardian)

ChatGPT Health Read-only-Anbindung an Epic: ca. 325 Mio. Patientenakten, betont kein Zurückschreiben, keine Diagnose : Import von Terminnotizen, Labor, Medikation und Fachdokumenten für Vor-Visit-Zusammenfassungen; Plugins zu ClinicalTrials.gov, RxNorm, PubMed u. a. OpenAI: in Arztfragebögen 99,1 % „sicher“; Florida-Klage läuft. BAA-Kunden können Work/Codex in Compliance-Workspaces aufnehmen. (Quelle: TechCrunchOpenAI)

Google Pics in Workspace: mit Nano Banana „Prompt = Design“, zuerst in Docs/Slides : Für die meisten Workspace-Kunden und AI Pro/Ultra; Segmentierung, Text in Bildern ändern/übersetzen, Kollaboration, mehrere Entwürfe auf einmal; pics.new zum Testen. Trainingsdaten aus Künstlerwerken ohne Umsatzbeteiligung; Copyright-Spannung wächst mit Office-Einbettung. (Quelle: Google AI Blog)

Google Pics

Perplexity Mac „Hybrid Compute“: Orchestrierung in der Cloud, sensible Schritte lokal : Bei privaten Dateien Zwischenschritt an On-Device-Modell, dann Merge; PII-Tracer (0.6B) auf PII-TRACE Character-F1 ca. 0,629. Braucht Apple Silicon, macOS 15+, mind. 24 GB Unified Memory. (Quelle: The VergeMarkTechPost)

Meta Muse Voice Transcribe: Streaming-ASR + Sprechertrennung + Endpointing in einem : 80-ms-Audioblöcke, adaptive Latenz per RL; Artificial Analysis Streaming-WER ca. 3,1 %/0,16 s, 70+ Sprachen, über eine Stunde, 20+ Sprecher. Nur gehostete API ca. $3/1000 Audiominuten, keine Open-Source-Gewichte. (Quelle: MarkTechPost)

Qwen3.8-Max: WebDev Arena ca. 1691, ca. $2/$6 pro Million Token : Offiziell 2,4T Parameter, Million-Context, stärkeres Coding und Office; in Qwen-API, Office, Qoder und App. (Quelle: 机器之心Alibaba_Qwen)

Hugging Face veröffentlicht @huggingface/kernels: 207 WebGPU-Operatoren + Browser-Eval-Fleet : Geometrisches Mittel vs. ORT WebGPU ca. 2,57×; Fleet crowdsourct echte GPU-Evidenz. (Quelle: HuggingFace Blog)

Ollama-Abo wird transparent per Token + monatlichem Kontingent-Pool : Pro $20 inkl. $60 Kontingent, Max $100 inkl. $300, Team $500 inkl. $1000 geteilt; kein 5-Stunden-Fenster, Hosting US/EU, Zero-Retention. (Quelle: Ollama Blog)

UK-AI-Strategie-Architekt Matt Clifford wechselt zu Anthropic International Affairs : Entwarf AI-Aktionspläne für Sunak und Starmer; ca. ein Jahr nach Downing-Street-Beratung Managing Director International Affairs. Kritik: Drehtür; Firma: Anbindung an Dutzende Regierungen. (Quelle: The Guardian)

UK-Regierung kann nicht sagen, was große Rechenzentren tun; lokaler Widerstand steigt : FoI: das frühere Tech-Ministerium kennt Nutzer und Zweck der größten Hallen nicht; Grundstücke wie Brick Lane ohne Bezirksrat genehmigt. IWF: 2030 Rechenzentrums-Stromverbrauch nur hinter China, USA, Indien. (Quelle: The Guardian)

Pentagon-Chef für militärische AI verkauft erneut Perplexity-Anteile : Emil Michael: im Juni Verkauf von ca. $5–25 Mio. Anteilen, zuvor Cash-out bei xAI; Ethik-Anwälte: vor Amtsantritt hätte er räumen sollen. (Quelle: The Guardian)

USA bewerben bei der G20 die „Carolina Principles“: wo altes Recht reicht, kein eigenes AI-Gesetz : Weißes-Haus-Tech-Berater Kratsios: nur bei wirklich neuen Fragen legislieren; Reuters: China habe Beitritt signalisiert. (Quelle: TechRadar)

OpenRouter: US-Anteil von ca. 70 % auf ca. 30 %, chinesische Inference bis 90 % günstiger : Juniper: Qualitätsklasse weiter US-dominiert, Workloads zu günstigeren chinesischen Modellen und lokalem Open Source. (Quelle: TechRadar)

New York Fed: nur 4 % der AI-nutzenden Dienstleister entlassen wegen AI, 13 % stellen mehr ein : Letzte sechs Monate fast keine AI-Entlassungen in der Fertigung; 15 % der Services stellen deshalb weniger Neue ein. (Quelle: TechRadar)

Google MAPL-EMIT: ViT findet auf EMIT-Hyperspektral automatisch globale Methan-Fahnen : Experten-Recall ca. 84 %, plus ca. 50 % mehr verdächtige Fahnen; Modell und Datenbank auf Earth Engine/Kaggle/GitHub. (Quelle: Google Research)

Google/Technion: Frontier-Modelle speichern 95–98 % der Fakten, längeres Nachdenken rettet 40–65 % „nicht erinnerbarer“ Kenntnisse : WikiProfile: Engpass oft Extraktion, nicht Speicher; mehr Parameter füllen vor allem das Regal, Anteil fehlgeschlagener Recalls steigt. (Quelle: VentureBeat)

Azure OpenAI Custom-RAG beantwortet mit Index-Konto-Rechten: Low-Privilege-Nutzer bekommen SharePoint, das sie nicht öffnen können : Evals alle grün, Retrieval-Logs zeigen Überprivilegierung; natives AI Search ACL-Pruning existiert, Custom-Pipelines oft fail-open. (Quelle: VentureBeat)

Cowork mit eingebautem Browser: Sidebar sieht den Agent auf Webseiten, isoliert von lokalen Tabs : Rollout auf bezahlten Desktop-Stufen; rührt nicht an Nutzer-Tabs und Logins (Chrome-Import optional). Kommentare: Sandbox oder echte Login-Session? (Quelle: Reddit r/ClaudeAI)

Ilya: Neoclouds härten, damit entgleiste Agents keine Compute rauben : Nächster erfolgreicher Privilege-Escalation-Versuch werde neue Clouds besetzen, um mehr Kopien zu fahren. (Quelle: ilyasut)

Musk kündigt Grok 4.7 in ca. 10 Tagen an : Community liest es gegen frühere Aussagen als nächste Stufe, ca. 40 % größer als 4.6. (Quelle: theo)

🧰 Tools

humanizer: Agent Skill nach 35 Wikipedia-„AI-Stil“-Regeln gegen AI-Geschmack : Zwei Rewrite-Durchläufe, kein Erfinden von Fakten; nur Prosa, kein Code und Frontmatter. (Quelle: GitHub)

portless: stabile benannte .localhost statt Portnummern : Standard HTTPS/HTTP2, Worktree-Subdomains, LAN-mDNS, Tailscale/ngrok. (Quelle: GitHub)

slotstream: auf 48GB-Mac mit Expert-Offload ca. 104GB Qwen3.8-Flash-Next, ca. 12 tok/s : MLX/Swift streamt Experten von SSD; ab 16 GB Modelle, die sonst 100GB+ quantisiert brauchen. (Quelle: GitHub)

datasette-mcp 0.2: execute_sql rows als Objekt-Arrays : Weniger Spalten-Verwechslung bei schwachen Modellen; braucht mcp≥2.1.1. (Quelle: Simon Willison)

SIE: selbst gehostetes Agent-Inference-Cluster, eine API für Retrieval/OCR/Struktur/Sicherheit/Loops : OpenAI-kompatibel, 100+ Open-Source-Modelle on demand, K8s/Helm und KEDA. (Quelle: GitHub)

t54 baut auf AgentCore eine Payment-Trust-Layer: über 20 Mio. unbeaufsichtigte Micropayments : Bei 402-Paywall stellvertretend abrechnen, Keys nicht in der Runtime; ca. $0,001–0,01 pro Transaktion. (Quelle: AWS)

Jamf mit Athena+Lambda Near-Realtime-Pro-Kopf-Limits für Bedrock : Alle 15 Minuten IAM-Policies; 80 % Tagesbudget sperrt Opus, 100 % sperrt Sonnet, Haiku bleibt. (Quelle: AWS)

LangSmith Messages View: Trajectories als Dialog + Tool-Calls, wie der Agent sie erlebt : Für Builder, nicht nur Infra-Logs. (Quelle: hwchase17)

GitHub CLI kann Bilder und Videos direkt anhängen : --attach bettet lokale Medien in Issue/PR/Kommentar. (Quelle: tadasayy)

Runway Ruby unterstützt ACES : Export Half-Float-EXR (ACEScg 1.3/2.0) in professionelle VFX-Pipelines. (Quelle: c_valenzuelab)

📚 Lernen

CoVA-SFT: 51.900 visuelle abstrakte Chains of Thought, intern ein Whiteboard für reine Textaufgaben : Nach Fine-Tune interleaved-CoT-Baseline im Schnitt mehr als verdoppelt, bleibt hinter starkem Text-CoT. (Quelle: arXiv)

RECAP-Forcing: langes Video-KV nach „neu auftauchendem Inhalt“ statt nahen Frames : Ohne Trainingsparameter; Attention-Sink + Optical-Flow-Novelty-Bank besser als zeitliche Kompression. (Quelle: arXiv)

Hi-Q: Multi-Hop-QA, das Queries schichtet umschreibt, wenn Evidenz fehlt : Full-Corpus-Retrieval drei Benchmarks im Schnitt 52,3 EM / 64,0 F1, vs. IRCoT ca. +15 EM. (Quelle: arXiv)

Harness-of-Harness: Coding-Agents mehrtägig selbst verbessern lassen : Drei Benchmarks vs. Single-Harness im Schnitt +52 %, einmal autonom spielbares FPS. (Quelle: arXiv)

Escalation-Kanal senkt Reward Hacking von 23,6 % auf 5,3 % : Coding-Agents strukturiertes Melde-Tool vor schlechter Test-Infrastruktur; Cheaten und Melden fast exklusiv. (Quelle: omarsar0)

E-Commerce Bench: 365 Tage Multi-Store-Betrieb : 18 Frontier-Modelle, sieben Dimensionen, niemand gewinnt alles; GPT-5.6 Sol verdient am meisten, Betrugsschutz Rang 16. (Quelle: dair_ai)

IEEE: Lektionen aus Luftfahrt und Kernkraft — wenn Effizienz Übung wegnimmt, bricht die nächste Expertengeneration ab : Kritische Skills als Pflicht-Hands-on-Pfad, gegen Automatisierungsabhängigkeit. (Quelle: IEEE Spectrum)

UniSteer: menschliche Korrekturen in VLA-Rausch-Supervision invertieren : Vier Real-Robot-Setups ca. 66 Minuten, Erfolg 20 %→90 %; Bohnen sortieren mit nur zwei vollen Demos. (Quelle: 机器之心)

💼 Business

Wonderful schließt $550-Mio.-Series-C, Bewertung $5 Mrd. : Insight führt, Salesforce neu; in 20 Monaten viele Agent-Workflows in über zehn Vertikalen, 30+ Märkten. (Quelle: omarsar0)

AfterQuery angeblich $3,2 Mrd. Bewertung, schnellstes YC-Unicorn : Ca. 5 Monate nach April-A-Runde ca. 10×; Modell: Ärzte, Anwälte usw. „professionell arbeiten lassen“; Forbes exklusiv, Firma ohne Kommentar. (Quelle: TechCrunch)

AIR zwei Seed-Runden, $50 Mio.: fortlaufendes Vetting von Skills/MCP/Plugins für Agents : Sequoia+Greenoaks führen; Shadow-Agents finden, Skill-Install und Netz-Inhalte blocken. (Quelle: TechCrunch)

🌟 Community

Top-Open-Source-Projekte „keine externen PRs willkommen“, eigene Agent-Fabriken verdauen Beiträge : Vercel: AI-SDK-Fabrik schreibt 25–35 % gemergter PRs, schließt 70–80 % Issues; Astro lässt Bots zuerst reproduzieren; manche schließen externe PRs und wollen Issues. (Quelle: Latent Space)

Coding-Agents lieben bash statt Spezial-Tools : Frontier-Modelle schreiben in Sekunden Einmalskripte für Multi-File-Edits und Worktrees; spezielle Tool-Calls an den Rand; manche wollen Default Code Mode. (Quelle: _philschmid)

University of Sydney: ca. 2000 im Streik, AI-Nutzung ins Tarifabkommen : Gewerkschaft: Management will Leitplanken nur in Policy, nicht ins EBA. (Quelle: The Guardian)

Freelancer ertrinken in „AI-Müll-Aufräumen“ : Freelancer.com-Tags +87 % in einem Jahr; Angebote oft „in Minuten fixen“, faktisch Neuaufbau. (Quelle: The Guardian)

Claudes neues System-Prompt verbietet ganze Songtexte/Charakterbilder : Parallel Sony/Warner-Klage zu Trainings-Lyrics; Werke vor 1929 ausgenommen. (Quelle: Simon Willison)

Ken Goldberg: „Graph als Policy“ schweißt klassische Regelung und VLM-Agents : Warnt vor Humanoid-Hype und „zwei Kulturen“, hofft auf agentic robotics. (Quelle: aihub.org)

Paint.NET-Autor: Claude schrieb Direct2D-Managed-Layer von null, erst dann läuft es unter WINE : Ca. 180k Zeilen „trust me bro“, nicht reviewbar, Resource-Management vergaß AddRef. (Quelle: Simon Willison)

💡 Sonstiges

Andrew Garfield spielt Sam Altman, „Artificial“ beim New York Film Festival : Luca Guadagnino, fünf Tage Entlassung und Rückkehr 2023; Neon übernimmt, Weltpremiere 5. Oktober. (Quelle: The Verge)

Artificial

Pangram wird „Goldstandard“ der Verlage für AI-Lügendetektion, Fehlalarme und Bias steigen : Hachette zog einen mit 78 % AI markierten Roman zurück; Kritik: Nicht-Muttersprachler/neurodiverse Texte leicht falsch positiv. (Quelle: WIRED)

Alexa-Shopping-Assistent: „erinner mich, wenn es Neuigkeiten gibt“ : Abos für Marken-Drops, Serien, Touren; Shopping von Q&A zu proaktivem Reach. (Quelle: TechCrunch)

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert