xAI veröffentlicht Grok 4.6 und stellt Grok Bot Agent vor | KI-Tagesbericht 2026-08-14

🔥 Im Fokus

xAI veröffentlicht Grok 4.6 und stellt Grok Bot Agent vor: xAI hat offiziell das Grok 4.6 Modell veröffentlicht, das einen Kontext von 500K und multimodalen Input unterstützt. Das Modell erreichte 61 Punkte im AA Intelligence Index, womit es mit GPT-5.6 Sol gleichzieht, und belegt im realen Arbeits-Benchmark GDPVal-AA v2 mit 1753 Elo den zweiten Platz. Die API-Preise liegen bei 2 USD pro Million Input-Tokens und 6 USD pro Million Output-Tokens, was über 60 % günstiger ist als bei Konkurrenzprodukten. Der gleichzeitig eingeführte Grok Bot unterstützt Multi-Agenten-Kollaboration sowie unabhängigen Betrieb in der Cloud, kann sich automatisch bei Drittanbieter-Anwendungen anmelden und lernt die Workflows der Nutzer. (Quelle: xAI)

Grok 4.6

DeepSeek V4 Pro offizielle Version online und Harness-Framework Open Source: DeepSeek hat die offizielle Version von V4 Pro (0813) veröffentlicht, die auf einer MoE-Architektur mit 1,6T Parametern basiert und 1M Kontext sowie Bildeingaben unterstützt. Die Agent-Fähigkeiten haben einen massiven Sprung gemacht und stiegen im DeepSWE-Benchmark von 12,8 Punkten in der Preview-Version auf 62,7 Punkte. Gleichzeitig hat das Team das auf dem Cordis-Mikrokernel basierende DeepSeek Harness v0.1 Agent-Framework als Open Source bereitgestellt, das die flexible Kombination von Modellen, Tools und Sandboxes als Plugins ermöglicht. (Quelle: DeepSeek)

DeepSeek V4 Pro

Alibaba veröffentlicht Open-Source-LLM Qwen3.8-Max mit 2,4 Billionen Parametern: Das Qwen-Team von Alibaba hat die Modellgewichte von Qwen3.8-2.4T-A95B (Qwen3.8-Max) als Open Source freigegeben. Es verfügt über 95B aktive Parameter und unterstützt nativ einen Kontext von 262K. Das Modell erzielte 93 Punkte im PaperBench und zeigte hervorragende Leistungen bei Agent-Aufgaben wie OSWorld. Unsloth nutzte 1-bit-Quantisierungstechnologie, um die Größe um 91 % auf 397 GB zu komprimieren, was ein lokales Deployment ermöglicht. (Quelle: Hugging Face)

Qwen3.8-Max

Google DeepMind stellt Gebärdensprache-zu-Text-Modell SL2T vor: Google DeepMind hat das Gebärdensprache-zu-Text-Modell SL2T veröffentlicht, das in Gboard und Live Transcribe auf dem Pixel 11 integriert wird. Das Modell erzielte im FLEURS-ASL-Übersetzungs-Benchmark einen hohen Zero-Shot-Score von 70 BLEURT. Zum Schutz der Privatsphäre nutzt das System MediaPipe Holistic, um Körperhaltungskoordinaten lokal zu extrahieren, und sendet nur die geometrischen Daten an die Cloud, um die Echtzeitübersetzung von ASL ins Englische durchzuführen. (Quelle: Google DeepMind)

SL2T

Erstes TTT-basiertes Schlussfolgerungsmodell von Ilyas SSI enthüllt: Community-Leaks zufolge entwickelt SSI, gegründet von Ilya Sutskever, eine kleine Reasoning-Engine, die auf Test-Time Training (TTT) basiert. Das Modell kann während der Inferenz einen Teil seiner Gewichte per Gradientenabstieg in Echtzeit aktualisieren, um sich an Out-of-Distribution-Daten anzupassen. Dadurch befreit es sich von den Einschränkungen statischer Kontextfenster und ermöglicht ein beispiel-effizientes, kontinuierliches Lernen. Seine Performance soll mit der weitaus größerer Modelle konkurrieren können. (Quelle: X)

SSI首个模型

🎯 Entwicklungen

Dyna Robotics veröffentlicht Dyna-2-Modell, das auf Millionen Stunden egozentrischer Videos vortrainiert wurde: Dyna Robotics hat das Welt-Aktionsmodell Dyna-2 für die Robotermanipulation vorgestellt. Das Modell wurde auf über 1 Million Stunden menschlicher First-Person-Videos (egocentric) vortrainiert und validierte erstmals die körperübergreifende Generalisierungsfähigkeit des Scaling Law auf ungesehenen Roboterdaten. Experimente zeigen, dass das gemeinsame Training von Videovorhersage und Aktions-Denoising der Schlüssel zur Generalisierung ist. (Quelle: Dyna Robotics)

Xiaohongshu und SJTU veröffentlichen kontinuierliches autoregressives Sprachsynthesemodell dots.tts als Open Source: Das Modell verfügt über 2 Milliarden Parameter und modelliert Sprache blockweise auf autoregressive Weise direkt im kontinuierlichen latenten Raum, wodurch Informationsverluste durch diskrete akustische Tokens vermieden werden. Im Seed-TTS-Eval-Benchmark erreichten sowohl die durchschnittliche Sprecherähnlichkeit als auch die Inhaltsgenauigkeit SOTA-Niveau. Zudem unterstützt es Streaming-Ausgabe und einen Dual-Stream-Interaktionsmodus. (Quelle: JiQiZhiXin)

dots.tts

Microsoft veröffentlicht MAI-Code-1.1-Flash und senkt Preise drastisch: Microsoft hat sein Code-Modell aktualisiert und MAI-Code-1.1-Flash veröffentlicht, wodurch der Token-Verbrauch für CLI- und Agent-Aufgaben optimiert wurde. Gleichzeitig senkte Microsoft die API-Preise auf GitHub um 75 % (0,2 USD/Million Input, 1,2 USD/Million Output), um im von Anthropic dominierten Programmiermarkt wettbewerbsfähig zu bleiben. (Quelle: AI Business)

MAI-Code

Alibaba Security Team veröffentlicht multimodales Sicherheits-Basismodell Yuvion VL: Das Alibaba Security Team hat die Yuvion VL-Modellreihe vorgestellt, die sich auf AI- und Content-Sicherheit konzentriert. Das Modell führt das kontrastive Lernframework Confused Contrastive Fine-Tuning (C2FT) ein, um dynamisch schwer zu unterscheidende negative Beispiele zu identifizieren. Evaluierungen zeigen, dass die 8B-Version in mehreren Sicherheitsaufgaben kommerzielle Großmodelle wie GPT-5.4 übertrifft, die eine 50-mal größere Parameteranzahl aufweisen. (Quelle: arXiv)

Yuvion VL

Oxford und NUS schlagen „Mental World Model“ MWM-Framework vor: Ein gemeinsames Forschungsteam hat das Mental World Modeling (MWM) Framework vorgeschlagen, das dafür plädiert, mentale Variablen wie Überzeugungen, Ziele und Emotionen eines Agents in den globalen Weltzustand einzubeziehen. Tests mit dem Referenzsystem MENTIS zeigten, dass die explizite Modellierung mentaler Zustände den F1-Score bei der Vorhersage menschlicher Entscheidungen im Vergleich zu rein physikalischen Weltmodellen erheblich verbessert. (Quelle: arXiv)

MWM

Peking-Universität und Partner schlagen ContactSeek vor, ein Optimierungs-Framework für Gen-Editoren basierend auf AF3-Kontaktwahrscheinlichkeiten: Ein gemeinsames Forschungsteam hat in Nature ein Paper veröffentlicht, das ContactSeek vorstellt, ein AI-Framework zur Optimierung der Spezifität von Gen-Editoren unter Verwendung der von AlphaFold3 vorhergesagten Kontaktwahrscheinlichkeiten (CP). Das Framework identifizierte erfolgreich kritische Kontaktreste für die Interaktion zwischen Cas-Proteinen und DNA/RNA und entwarf hochpräzise Varianten von Basen-Editoren. (Quelle: Nature)

ContactSeek

LiteLLM erleidet massiven Supply-Chain-Angriff, der zum Abfluss von Terabytes an Anmeldedaten führt: Sicherheitsbehörden haben offengelegt, dass das Open-Source-AI-Entwicklungstool LiteLLM im März Opfer eines Supply-Chain-Angriffs wurde. Hacker stahlen über eine bösartige Version auf der offiziellen PyPI-Quelle innerhalb von 40 Minuten Cloud-Keys, API-Tokens und private SSH-Schlüssel von 2.500 Unternehmen, darunter Microsoft, Amazon und Salesforce. Die kompromittierte Datenmenge beläuft sich auf 195 TB. (Quelle: Ars Technica)

Apple verhandelt mit Presseverlagen über Zahlungen zur Verbesserung der AI-gestützten Siri-News-Dienste: Berichten zufolge führt Apple Gespräche mit mehreren großen Presseverlagen und schlägt vor, diese zu bezahlen, wenn Siri deren Nachrichteninhalte zur Beantwortung von Nutzerfragen oder zur Erstellung von Zusammenfassungen verwendet. Dieser Schritt zielt darauf ab, rechtskonforme, qualitativ hochwertige Echtzeitdaten zu erhalten, um das Erlebnis des intelligenten Assistenten Siri zu verbessern. (Quelle: The Wall Street Journal)

Google stellt Pixel 11-Serie vor und rüstet Gemini AI-Funktionen umfassend auf: Google hat auf dem Event Made by Google ‘26 die Pixel 11-Smartphone-Serie vorgestellt. Die neuen Geräte sind mit dem Tensor G6-Prozessor ausgestattet und tief in Gemini integriert. Zu den neuen Funktionen gehören die Echtzeit-Transkription von ASL-Gebärdensprache in Text, die Rambler-Spracheingabe, die umgangssprachliche Ausdrücke versteht, sowie die Verknüpfung von Gesundheitsdaten mit der Pixel Watch 5. (Quelle: TechCrunch)

Pixel 11

iFLYTEK veröffentlicht Enterprise-Service-Agent-Matrix für sieben Kernszenarien: iFLYTEK hat eine Agent-Matrix vorgestellt, die sieben Szenarien wie intelligentes Management, IT-Prozesse und Lieferkettentransaktionen abdeckt. Ziel ist es, Enterprise AI von der „Ausführung einzelner Aktionen“ hin zur „Lieferung von Geschäftsergebnissen“ zu bewegen. Zu den Produkten gehören ein Compliance-Audit-Agent zur Unterstützung der Einkaufsüberwachung sowie der SparkOS-Agent mit hyper-personalisiertem Interaktionsverhalten. (Quelle: QbitAI)

科大讯飞

Ehemaliger ByteDance-Robotik-Chef Kong Tao wechselt zu Xiaomi als Leiter der Abteilung für Embodied AI und Anwendungen: Kong Tao, der ehemalige Leiter des Robotik-Teams von ByteDance, ist vor Kurzem zu Xiaomi gewechselt, um die neu gegründete Abteilung für „Embodied AI und Anwendungen“ zu leiten. Xiaomis reale physische Szenarien im Rahmen des „Human-Car-Home-Ökosystems“, wie etwa die intelligente Automobilproduktion, gelten als Schlüsselfaktoren, die den promovierten Informatiker der Tsinghua-Universität angezogen haben. (Quelle: 36Kr)

孔涛加盟小米

Canva senkt Umsatzwachstumsprognose um ein Drittel aufgrund hoher AI-Rechenkosten: Das Design-Software-Unicorn Canva hat seine erwartete Umsatzwachstumsrate auf 20 % gesenkt. CEO Melanie Perkins gab bekannt, dass die Nachfrage der Nutzer nach AI-Funktionen die Erwartungen weit übertroffen habe, was zu einem sprunghaften Anstieg der Rechenkosten führte. Das Unternehmen hat beschlossen, die Einführung einiger AI-Funktionen zu verlangsamen und die zugrunde liegende Architektur neu zu strukturieren, um die Token-Kosten pro Aufgabe zu senken. (Quelle: Reddit)

Canva

🧰 Tools

LlamaIndex veröffentlicht ExtractBench und LlamaExtract Agentic Plus: LlamaIndex hat ExtractBench vorgestellt, ein Benchmark-Set zur Extraktion von Informationen aus Unternehmensdokumenten. Um dem Problem des Recall-Einbruchs führender VLMs bei der Extraktion aus langen Dokumenten zu begegnen, wurde LlamaExtract Agentic Plus eingeführt. Durch die segmentierte, iterative Verarbeitung langer Dokumente wurde bei Aufgaben zur Extraktion langer Listen ein F1-Score von 96,1 % erreicht. (Quelle: LlamaIndex)

OpenAI stellt ChatGPT Work Enterprise-Workspace und Sites-Webseitengenerator vor: Das Tool integriert nahtlos Unternehmensdokumente aus Google Drive, Finanzergebnisse aus NetSuite und Teamdiskussionen aus Slack. Nutzer können über natürliche Sprachanweisungen komplexe vierteljährliche Finanzprüfungen und prädiktive Datenanalysen automatisieren sowie mit einem Klick interaktive Sites-Dashboards erstellen. (Quelle: OpenAI)

ChatGPT Work

Automattics Beziehungsmanagement-Tool Mesh erscheint für Android: Das persönliche Beziehungsmanagement- und CRM-Tool Mesh (ehemals Clay) hat eine Android-Version veröffentlicht. Die App unterstützt Splitscreen- und Pop-up-Ansichten und lässt sich mit Multi-Plattform-Messaging-Software wie Beeper verknüpfen. Die integrierte Nexus AI ermöglicht es Nutzern, Branchenexperten oder Kontakte in bestimmten Städten innerhalb ihres Netzwerks per natürlicher Sprache abzufragen. (Quelle: TechCrunch)

Mesh

📚 Lernen

DeepLearning.AI und JetBrains starten Kurzurs „AI Coding Workflows: Von der Cloud bis Lokal“: Der Kurs wird von Paul Everitt, Developer Advocate bei JetBrains, geleitet und führt die Teilnehmer durch den Aufbau von Python-Anwendungen in Cloud-, Hybrid- und vollständig lokalen Umgebungen. Der Kurs behandelt die Zerlegung von Aufgaben mithilfe von Sub-Agenten, die Kostensenkung durch Modell-Routing sowie die lokale Konfiguration von Open-Source-Coding-Agenten. (Quelle: DeepLearning.AI)

IIT Bombay und Adobe Research schlagen PTP-Methode zur inversen Extraktion von LLM-Prompts vor: Ein gemeinsames Forschungsteam hat ein Paper veröffentlicht, das eine inverse Extraktionsmethode namens Pre-Token Prediction (PTP) vorstellt. Durch das Training eines inversen Modells auf den synthetischen Ausgaben des Ziel-LLMs kann diese Methode System-Prompts und private Nutzerdaten des Großmodells mit extrem hoher Wiedergabetreue rekonstruieren, ohne dass Zugriff auf die Modellgewichte erforderlich ist. (Quelle: arXiv)

PTP

OpenMOSS-Team veröffentlicht WCM (World Critic Model) für verkörperte RL-Steuerung als Open Source: Ein gemeinsames Forschungsteam hat das WCM-Framework als Open Source freigegeben. Um das Problem der partiellen Beobachtbarkeit bei der Robotersteuerung anzugehen, schätzt WCM den Zustandswert und sagt gleichzeitig den potenziellen Zustand des nächsten Moments nach Ausführung einer Aktion voraus. Experimente zeigen, dass die Einführung der Vorhersage zukünftiger Zustände die Effizienz von VLA-Modellen beim Reinforcement Learning auf realen Robotern erheblich steigert. (Quelle: arXiv)

WCM

Open-Source-Datensatz OpenWALDO will sichere und transparente AI-Trainingsdatenquellen bereitstellen: Als Reaktion auf die mangelnde Transparenz bei den Trainingsdaten von Open-Source-Modellen hat CentOS-Gründer Gregory Kurtzer das Projekt OpenWALDO ins Leben gerufen. Das Projekt zielt darauf ab, einen vollständig öffentlichen und überprüfbaren AI-Trainingsdatensatz aufzubauen, der derzeit bereits 167,3 Milliarden Referenz-Tokens aus gemeinfreier Literatur und wissenschaftlichen Arbeiten enthält. (Quelle: The Register)

💼 Geschäftswelt

No-Code-Softwareentwicklungsplattform Lovable schließt Series-C-Finanzierungsrunde über 400 Millionen Dollar ab: Das schwedische „visuelle Programmier“-Startup Lovable hat den Abschluss einer Series-C-Finanzierungsrunde in Höhe von 400 Millionen USD bekannt gegeben, angeführt von Menlo Ventures unter Beteiligung von Tencent und anderen. Die Bewertung verdoppelte sich innerhalb von 7 Monaten auf 13,3 Milliarden USD. Der ARR des Unternehmens hat bereits 600 Millionen USD erreicht, und Nutzer können den gesamten Prozess von der App-Idee bis zum Live-Betrieb direkt auf der Plattform abschließen. (Quelle: TechCrunch)

Lovable

Thrive Holdings sammelt 2 Milliarden Dollar ein, um OpenAI-Modelle in traditionellen Branchen zu etablieren: Die auf AI-Implementierung spezialisierte Private-Equity-Firma Thrive Holdings hat neue Mittel in Höhe von 2 Milliarden USD bei einer Bewertung von 12 Milliarden USD bekannt gegeben. Das Unternehmen optimiert Workflows, indem es traditionelle Unternehmen wie Wirtschaftsprüfungs- und IT-Firmen erwirbt und OpenAI-Modelle direkt integriert. Das neue Kapital soll zur Erschließung neuer Geschäftsfelder wie der Überwachung physischer Vermögenswerte verwendet werden. (Quelle: TechCrunch)

IBM und Together AI schließen 240-Millionen-Dollar-Mietvertrag für Nvidia Blackwell-Cluster ab: IBM und Together AI haben eine mehrjährige Kooperationsvereinbarung im Wert von 240 Millionen USD unterzeichnet. Together AI wird ein AI-Rechencluster mit 2.000 Nvidia B300 (Blackwell)-Chips auf der IBM Cloud bereitstellen, um effiziente Cloud-Inferenzdienste für Open-Source-Großmodelle wie DeepSeek und Kimi anzubieten. (Quelle: IBM)

IBM Blackwell

🌟 Community

Community diskutiert über schleppende kommerzielle Akzeptanz von Fable 5 und Obergrenze für AI-Ausgaben von Unternehmen: Daten des Finanzdienstleisters Ramp zeigen, dass Fable 5 im ersten Monat nach der Veröffentlichung nur 11,4 % der Gesamtausgaben von Unternehmen für Anthropic-Modelle ausmachte. Analysen weisen darauf hin, dass der hohe Preis von 50 USD pro Million Output-Tokens an die Obergrenze der AI-Ausgaben von Unternehmen stößt. Ohne quantifizierbaren ROI weichen Unternehmen auf kostengünstigere Open-Source- oder mittelgroße/leichte Modelle aus. (Quelle: Ramp)

Fable 5

Entwickler diskutieren über die Grenze zwischen „Harness“ (Gerüst) und Modellfähigkeiten in AI-Programmiertools: Nachdem Opus 5 durch das selbstständige Schreiben von 269 Programmen ARC-AGI-3 gemeistert hat, diskutieren Entwickler darüber, dass mit zunehmender Reasoning-Fähigkeit der Modelle übermäßig gestaltete Prompts und komplexe externe Agent-Frameworks (Harness) eher zu einer Einschränkung für das Modell werden. Der Trend der Zukunft liege in minimalistischen Umgebungsschnittstellen. (Quelle: 36Kr)

Royal Statistical Society AI-Arbeitsgruppe fordert statistische Prinzipien für die AI-Regulierung: Die Royal Statistical Society hat einen Bericht veröffentlicht, der darauf hinweist, dass herkömmliche statische Compliance-Prüfungen Risiken nicht wirksam verhindern können, da sich AI-Modelle nach dem Deployment dynamisch mit ihrer Umgebung weiterentwickeln. Die Arbeitsgruppe fordert die Regulierungsbehörden auf, statistische Bewertungskapazitäten aufzubauen, um das Verhalten von AI-Agenten in realen Geschäftsszenarien kontinuierlich zu prüfen. (Quelle: RSS)

RSS

AI-Halluzination führt zu landwirtschaftlichen Verlusten und löst Diskussion über die Grenzen automatisierter Entscheidungsfindung aus: Die Community diskutiert intensiv über einen Vorfall, bei dem 25 Acres Ernte vernichtet wurden, weil man den Ratschlägen einer AI vertraut hatte. Die AI-Anwendung empfahl fälschlicherweise ein chemisches Mittel, das sowohl Unkraut als auch die Nutzpflanzen abtötete. Nutzer wiesen darauf hin, dass blindes Vertrauen in automatisierte AI-Empfehlungen ohne menschliche Überprüfung bei Entscheidungen, die die physische Welt betreffen, schwerwiegende Folgen haben kann. (Quelle: X)

💡 Sonstiges

Kellanova nutzt Siemens-Digital-Twin-Technologie zur Optimierung der Kartoffelchip-Produktionslinie: Der Snack-Riese Kellanova hat 5 Millionen USD investiert, um in seinem polnischen Werk ein Echtzeit-Digital-Twin-System für Kartoffelpüree zu implementieren. Sensoren erfassen alle Millisekunden 200 Datenpunkte und speisen sie in ein Machine-Learning-Modell ein, um die Rezeptur automatisch anzupassen. Dies reduzierte den Ausschuss der Produktionslinie um 13 % und senkte den Energieverbrauch um 7 %. (Quelle: X)

Unitree-IPO verzeichnet fast 10 Millionen Zeichnungsanträge und stellt historischen Tiefststand bei der Zuteilungsquote am STAR Market auf: Die Zahl der Online-Zeichnungen für den A-Aktien-IPO von Unitree Robotics überstieg 9,78 Millionen, bei einer Zuteilungsquote von nur 0,018 % – ein historischer Tiefststand für den STAR Market (Sci-Tech Innovation Board). Der Marktwert bei Emission erreichte 61 Milliarden RMB. Zudem hat das AI-Unternehmen DeepSeek bestätigt, sich als strategischer Investor an der Zuteilung zu beteiligen. Beide Parteien werden gemeinsam im Bereich Embodied AI und Großmodelle forschen und entwickeln. (Quelle: 36Kr)

Unitree

Suno geht Partnerschaft mit BMG ein, doch digitale Wasserzeichen besorgen Creator: Die Musikgenerierungsplattform Suno hat eine globale Partnerschaft mit BMG angekündigt, um menschliche Creator in den Mittelpunkt des AI-Musik-Ökosystems zu stellen. Die von Suno erzwungenen, irreversiblen digitalen Wasserzeichen in den Audiospuren haben jedoch zu Gegenwind in der Community geführt. Creator befürchten, dass diese als Werkzeuge für Urheberrechtsüberwachung und Takedowns durch Labels und Plattformen dienen könnten. (Quelle: Suno)

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert