🔥 В фокусе
Google представила Gemini Agent — первого корпоративного офисного агента с беспрецедентной поддержкой вызова Claude : На конференции Gemini at Work 2026 компания Google официально представила корпоративного офисного агента Gemini Agent, полностью интегрированного в экосистему Workspace. Агент ориентирован на достижение целей (goal-driven), обладает возможностями долговременного облачного присутствия и оркестрации множества приложений. Компании могут выделять ему отдельный корпоративный почтовый ящик, аккаунт, хранилище и календарь, используя его в качестве «цифрового коллеги» (Coworker Agent) с собственной цифровой идентичностью. Архитектура системы включает четыре уровня постоянной памяти (диалоговую, семантическую, процедурную и эпизодическую), полностью поддерживает Slack, Salesforce и протокол MCP. Кроме того, в корпоративном селекторе моделей впервые в виде исключения появился доступ к моделям конкурента Anthropic — Claude Opus 5 и Sonnet 5.5. Это знаменует переход конкуренции техногигантов от простого сравнения возможностей базовых моделей к полномасштабной борьбе за статус точки входа в экосистему на уровне инфраструктуры рабочих процессов и управления правами доступа (Источник: Google, TechCrunch, AI Business, 36氪)

Бывшие исследователи безопасности OpenAI опубликовали открытое письмо, обвинив руководство в расправе с инакомыслием под предлогом «утечек» и препятствовании аудиту безопасности : Jasmine Wang, Tomek Korbak и Mikita Balesni, трое ведущих исследователей безопасности, неожиданно уволенных из OpenAI, опубликовали совместное открытое письмо, публично опровергнув обвинения компании в «ненадлежащем обращении с конфиденциальной информацией и подрыве доверия». В письме раскрывается, что истинной причиной увольнения стали их серьезные предупреждения о резком снижении «отслеживаемости цепочки рассуждений» (CoT Monitorability) у агентов и активное продвижение реального сотрудничества с независимой аудиторской организацией METR (Korbak выступал ключевым контактным лицом). Исследователи предупреждают, что руководство ради ускорения коммерциализации урезает полномочия внешней независимой оценки, а внезапные и непрозрачные дисциплинарные меры вызвали эффект подавления критики (chilling effect) внутри компании, сделав внутренний раскол между миссией безопасности и коммерческими интересами абсолютно явным (Источник: The Verge, THE DECODER, Transformer, EthanJPerez)

Расхождение в оценке годовой выручки OpenAI достигло 20 млрд долларов, вызвав колебания на рынках капитала и переоценку темпов монетизации : По сообщениям британской Financial Times и других СМИ, OpenAI уведомила инвесторов о том, что ее фактическая годовая регулярная выручка (ARR) на конец сентября приблизилась к 50 млрд долларов. Это создало заметный разрыв примерно в 20 млрд долларов по сравнению с цифрами в 68–70 млрд долларов, ранее циркулировавшими на рынке и в моделях инвестбанков, что привело к коррекции акций технологического сектора и вычислительной инфраструктуры. Аналитики отмечают, что расхождение обусловлено методикой учета: в прежних оценках ошибочно применялся расширенный стандарт расчета, аналогичный используемому Anthropic (где в выручку включается общий валовой оборот через дистрибьюторов вроде AWS и Google Cloud), тогда как OpenAI не учитывает стороннюю облачную дистрибуцию и вычитает 20%-ную долю Microsoft (при пересчете по валовому обороту ее фактический объем был бы близок к 64 млрд долларов). Этот инцидент подчеркнул уязвимость рынков капитала в условиях отсутствия публичной аудированной финансовой отчетности и побудил индустрию пересмотреть реальные темпы роста прибыльности на фоне огромных затрат на вычисления для больших моделей (Источник: The Guardian, CNBC, 36氪)

OpenAI представила сверхбыструю версию GPT-6.1 Sol Ultrafast: ускорение пропускной способности инференса в 8 раз и внедрение мгновенного потокового управления : OpenAI выполнила обещание четвертого дня марафона «28 дней релизов», официально запустив режим GPT-6.1 Sol Ultrafast в Responses API, Codex и ChatGPT Work. Модель сохраняет уровень логического рассуждения, близкий к флагманской Astra, при этом увеличивая пропускную способность генерации в 8 раз по сравнению со стандартной версией (около 300 tokens/s). Она также оснащена функцией мгновенного управления (Steering), позволяющей разработчикам динамически внедрять корректирующие промпты непосредственно во время потоковой генерации для мгновенного исправления траектории. Цены в API установлены на уровне 12 долларов за 1 млн входных токенов и 60 долларов за 1 млн выходных токенов (в 6 раз выше стандартной версии), а в интерфейсе ChatGPT доступ открыт только для пользователей Pro 500 (с подпиской 500 долларов в месяц) и корпоративных клиентов. Экстремально высокая скорость расхода лимитов вызвала в сообществе разработчиков споры о «скрытом масштабном повышении цен» (Источник: OpenAI, 机器之心, BorisMPower, 36氪)
.jpg)
Австралийский гигант вычислительных мощностей для AI Firmus отозвал IPO на 44 млрд австралийских долларов из-за слабого спроса: охлаждение опережающих премий на вторичном рынке инфраструктуры : Австралийская фабрика вычислений с иммерсионным жидкостным охлаждением Firmus Technologies, поддерживаемая NVIDIA и Blackstone Group, официально отозвала заявку на первичное публичное размещение акций. Проект планировал привлечь 5,5 млрд долларов при оценке в 30,6 млрд долларов (около 44 млрд австралийских долларов), что могло стать крупнейшим IPO на австралийской бирже почти за три десятилетия. Однако из-за выхода ключевых партнеров, того факта, что из запланированных 912 МВт реально подключено к сети и введено в эксплуатацию лишь 46 МВт, а также долговой нагрузки компании на будущую инфраструктуру в размере до 30 млрд долларов, институциональные инвесторы отказались оплачивать завышенную опережающую премию, и процесс формирования книги заявок провалился. Это событие стало важным поворотным моментом, охладившим настроения на вторичном рынке капиталоемкой и закредитованной вычислительной AI-инфраструктуры по всему миру (Источник: The Guardian, 36氪)

🎯 Тренды
Anthropic обновила политику использования, запретив жестокое обращение с моделями, и запустила защитную программу Cyber Mission : Anthropic опубликовала редакцию политики использования на 2026 год (вступает в силу 12 ноября). Впервые в индустрии прямо запрещено «постоянное и необоснованное жестокое обращение или грубость по отношению к моделям», а модели получили право самостоятельно прекращать диалог при экстремально вредоносных атаках. Хотя компания подчеркивает, что это не затрагивает стандартную отладку, пункт вызвал широкие этические дебаты о «моральной субъектности машин». В то же время Anthropic запустила инициативу Cyber Mission совместно с такими гигантами, как Booz Allen, для продвижения защиты критической инфраструктуры (CIDP), а также запустила OSS Scanner для бесплатного постоянного поиска уязвимостей с помощью AI и автоматизированной генерации патчей для ключевого открытого базового ПО (Источник: Anthropic News, The Guardian, mustafasuleyman)

В Claude появились генерация анимированных видео и динамические дашборды, офисный пакет полностью вышел из публичной беты : Anthropic добавила в Claude две важные интерактивные функции: Dashboards поддерживает прямое подключение к корпоративным источникам данных, таким как Snowflake, BigQuery и Salesforce, генерируя интерактивные графики в реальном времени с трассировкой SQL-запросов через команды на естественном языке; Claude Motion позволяет преобразовывать текст и архитектурные схемы в редактируемые динамические пояснения на базе кода с возможностью экспорта в 30-секундные MP4-видео. Кроме того, три корпоративных пакета — Docs, Slides и Design — официально завершили бета-тестирование и стали коммерчески доступными, что знаменует ускоренный переход Claude от диалогового интерфейса к динамическому мультимедийному офисному хабу (Источник: The Verge, THE DECODER, dotey)

Google раскрыла в журнале The Lancet результаты медицинской клинической AI-системы AMIE: совпадение диагнозов 90% и ноль сбоев безопасности : Google опубликовала в главном выпуске журнала The Lancet мультицентровое клиническое исследование: ее диалоговая интеллектуальная система медицинской диагностики AMIE достигла прорывных результатов в реальных отделениях неотложной помощи и амбулаторной практики. За 100 продолжительных сессий взаимодействия с реальными пациентами система не допустила ни одного сбоя в плане безопасности, а точность ее диагностических заключений совпала с оценками опытных профильных врачей-практиков на 90%. Кроме того, система превзошла контрольную группу по эмпатии в общении и полноте сбора анамнеза, продемонстрировав надежность внедрения мультимодального клинического AI в критически важные рабочие процессы (Источник: Google)
Команда ByteDance Seed раскрыла причину нестабильности DeepSeek при обработке длинного контекста: блочный KV Cache чувствителен к фазе в 4 токена : Исследовательская группа Seed из ByteDance экспериментально установила, что колебания производительности DeepSeek-V4 при поиске по длинному контексту сильно зависят от физического расположения входной информации. Исследование показало, что добавление даже незначительного количества бессмысленных символов перед промптом для изменения «фазы» (Phase) токена в окне компрессии приводит к резким периодическим колебаниям точности поиска модели в контексте 128K с разбросом до 40,2 процентного пункта. Период колебаний в точности совпадает с шагом сжатия блочного KV Cache (4 токена), что выявило системную уязвимость поиска, вызванную аппаратно-ориентированной оптимизацией компрессии (Источник: 量子位)

Пять транснациональных фармгигантов объединились для оптимизации OpenFold3 с помощью федеративного обучения: неопубликованные структурные данные значительно улучшили предсказание связывания лекарств : Пять фармацевтических гигантов — AbbVie, Bristol Myers Squibb, Johnson & Johnson, Takeda и Astex — опубликовали совместное исследование в журнале Nature, где через сеть конфиденциальных вычислений объединили более 20 тысяч неопубликованных высокоточных экспериментальных структур комплексов «белок — малая молекула» для федеративного пост-тренинга открытой модели OpenFold3. Эксперименты подтвердили, что без передачи проприетарных коммерческих данных за пределы локальных дата-центров компаний точность прогнозирования взаимодействия «белок-лиганд» выросла более чем на 10%, существенно превзойдя базовую модель, обученную только на открытых данных PDB (Источник: Nature, 机器之心)
.jpg)
Alibaba Tongyi выложила в открытый доступ модель генерации изображений Qwen-Image-2.1-Turbo: количество шагов шумоподавления сокращено до 8 : Команда Alibaba Tongyi официально выпустила с открытым исходным кодом 7B модель визуальной генерации Qwen-Image-2.1-Turbo, открыв веса и API. Сохраняя качество 2K HD и способность редактировать сложные изображения по текстовым инструкциям, эта версия благодаря передовой дистилляции траекторий сократила количество шагов денойзинга всего до 8. Это радикально снизило требования к видеопамяти и задержку генерации; разработчики уже могут развернуть модель в один клик через пайплайн Diffusers и бесшовно интегрировать ее в высоконагруженные производственные конвейеры (Источник: Alibaba_Qwen)

Shengshu Technology выпустила превью-версию Vidu Q4: упор на выразительную актерскую игру и 16-секундное непрерывное движение камеры : Shengshu Technology представила флагманскую предварительную версию генератора видео нового поколения Vidu Q4. Релиз демонстрирует прогресс в кинематографической стабильности планов «восьмерка» (shot-reverse-shot), тонкой передаче смены эмоций и взаимодействии света и тени с окружением. Модель поддерживает привязку консистентности объекта по 15 референсным изображениям и 3 аудиодорожкам, а также нативно поддерживает вывод в 4K и непрерывное движение камеры от первого лица (FPV) длительностью до 16 секунд. В SaaS-версии в рамках промо-акции стоимость генерации в 720P снижена до 0,09 юаня за секунду, что существенно снижает порог входа для создания AI-сериалов и рекламы (Источник: 量子位)

Aether AI представила каузальную робототехническую систему CRIS-0: уклонение от препятствий за 0,2 секунды на основе каузальных переходов состояний : Стартап Aether AI, основанный командой Бивэй Хуан (Biwei Huang) из Калифорнийского университета в Сан-Диего, представил воплощенную (embodied) систему CRIS-0 на базе причинно-следственного интеллекта. Архитектура преодолевает ограничения традиционных моделей Vision-Language-Action (VLA), опирающихся исключительно на подгонку пиксельных корреляций: с помощью каузальной модели мира (CausalWM) она прогнозирует последствия действий и отслеживает физические переменные причинно-следственных состояний. При возникновении внезапных внешних помех, вызванных человеком, система способна выполнить экстренное торможение за 0,2 секунды и динамическое перепланирование за 2 секунды, эффективно предотвращая сбои из-за накопления ошибок в длительных задачах (Источник: 量子位)

JetBrains выпустила Mellum2.1 — специализированную MoE-модель для кода на 12B параметров с активацией всего 2.5B : JetBrains представила открытую рассуждающую модель для кода Mellum2.1-12B-A2.5B-Thinking. Модель построена на архитектуре MoE с 64 экспертами, активируя лишь 8 экспертов (2.5B параметров) на токен, и нативно поддерживает контекст 128K. Благодаря масштабному обучению с подкреплением на взаимодействии со средой в реальных репозиториях ПО, ее результат на LiveCodeBench v6 достиг 82,0 балла, а процент решения задач на SWE-bench Verified подскочил с 2,0% до 47,0% при пропускной способности на одной карте H200 почти вдвое выше, чем у Qwen3.5-9B (Источник: MarkTechPost)
TII открыла мультиязычную голосовую модель Falcon ASR на 1.6B параметров, обновив рекорд распознавания диалектов ОАЭ : Институт технологических инноваций Абу-Даби (TII) открыл мультиязычную модель автоматического распознавания речи Falcon-ASR на 1.6B параметров. Построенная на архитектуре Falcon3-Audio, модель специально решает проблемы распознавания арабского языка в условиях сложного шума и переключения между языками. На шести стандартных тестовых наборах арабского языка она показала показатель пословной ошибки (WER) 20,92%, а в тестах на местных диалектах ОАЭ достигла WER 22,73%, превзойдя Qwen3-Omni, и нативно поддерживает временные метки на уровне слов в рамках единого набора весов (Источник: HuggingFace Blog)

OpenAI выявила и заблокировала сеть когнитивных манипуляций на базе AI, маскировавшуюся под фальшивых журналистов и аналитические центры : OpenAI опубликовала отчет о специальном расследовании, объявив о блокировке двух вредоносных сетей, использовавших ChatGPT для скрытого геополитического когнитивного манипулирования. Российская группировка под кодовым названием «Dark Clark» контролировала фиктивные аналитические центры, внедряя сфабрикованные аудиозаписи и официальные документы в латиноамериканские СМИ и провоцируя опровержения политиков (угрозе присвоен максимальный уровень Breakout 5). Иранская группировка «Bogus Bylines» создала 7 фальшивых журналистских личностей, опубликовав в коммерческих интернет-СМИ около сотни заказных материалов по тематике американо-иранского противостояния (Источник: OpenAI News)
Amazon Bedrock AgentCore представила микроплатежи на уровне запросов и протокол управления x402 : AWS объявила об интеграции Coinbase CDP и Stripe Link в Bedrock AgentCore, что позволяет автономным агентам совершать микроплатежи на уровне запросов по протоколу x402 без участия человека. Система на базовом инфраструктурном уровне задает жесткий лимит расходов для защиты от превышения полномочий через промпт-инъекции и поддерживает ончейн-расчеты в реальном времени с суммами вплоть до микроцентов, закладывая протокольную основу для создания коммерческих агентов, способных самостоятельно закупать внешние вычислительные ресурсы, данные и цифровые сервисы (Источник: AWS Machine Learning Blog)

🧰 Инструменты
Объединение TRAE: TraeCode и TraeWork слились в многоагентную платформу полноцикловой разработки : Принадлежащий ByteDance инструмент для AI-программирования TRAE объединил два своих клиента в единое приложение, интегрировав изолированную среду редактирования кода и документоориентированные рабочие процессы. Новая версия предлагает «Режим агента» в виде глобального холста и «Режим IDE», сохраняющий классический процесс редактирования. Пользователи могут в рамках одной директории проекта параллельно оркестровать нескольких агентов планирования, разработки и тестирования для конвейерной работы. Патчи кода и проектные требования сохраняются в общем репозитории артефактов, а также реализована кроссплатформенная синхронизация с Feishu и WeChat (Источник: 量子位)

Собственный агент для кода Lenovo TianxiCode возглавил бенчмарк SWE-bench-Live: показатель самовосстановления в замкнутом цикле превысил 71% : Собственный агентный фреймворк для написания кода TianxiCode от Lenovo Tianxi AI в связке с DeepSeek-v4.1-Flash занял первое место в авторитетном динамическом бенчмарке SWE-bench-Live (список Lite) с официально подтвержденным результатом решения задач в 71%. Благодаря многошаговому межфайловому поиску, прецизионному разделению контекста и автономному замкнутому циклу тестирования патчей система позволяет модели самостоятельно проверять ошибки выполнения в изолированной среде и динамически их исправлять, задавая высоконадежную парадигму применения AI в сложном промышленном программировании (Источник: 量子位)

galahad-kv: повторное использование памяти без перерасчетов для 50 млн токенов на базе локальных высокоскоростных NVMe-дисков : Для решения проблем с энергопотреблением и нехваткой видеопамяти при повторных прямых проходах (forward pass) в сверхдлинном контексте открытая библиотека для инференса galahad-kv реализовала сохранение блочных состояний KV-кэша на базе локальных высокоскоростных зашифрованных NVMe-дисков. В тестах с моделью Gemma 4 на одной карте H100 система обеспечила извлечение любых 16k-блоков из непрерывного потока данных объемом 50 млн токенов за секунды без перерасчета, ускорив процесс в 2,8–4,3 раза по сравнению с вычислениями в реальном времени, снизив энергопотребление GPU более чем на 88% и сохранив постоянный объем используемой видеопамяти на протяжении всего процесса (Источник: HuggingFace Daily Papers)
SwiftUI-Agent-Skill: библиотека специализированных навыков современной SwiftUI для агентов-программистов : Готовая к использованию база правил, созданная экспертами по iOS специально для таких программных агентов, как Claude Code, Codex и Cursor. Оформленная по открытой спецификации Agent Skills, она устраняет частые ошибки ведущих LLM при генерации кода SwiftUI: вызовы устаревших API, отсутствие меток доступности VoiceOver и провоцирование лишних перерисовок интерфейса. Поддерживает установку в один клик через npx или маркетплейс плагинов Claude, позволяя разработчикам на естественном языке запускать точный код-ревью производительности верстки и безопасности параллелизма (Источник: GitHub Trending)
Microsoft открыла mxc — кроссплатформенную систему изолированных песочниц для защиты от вредоносных действий агентов в терминале : Microsoft открыла исходный код легковесного фреймворка для изолированного исполнения кода mxc. Инструмент направлен на нейтрализацию рисков эскалации привилегий из-за растущего числа вызовов локального терминала и файловой системы современными автономными агентами. Построенный на базе Bubblewrap, Seatbelt и системных контейнеров процессов, он позволяет опенсорсным инструментам разработки менее чем за 100 мс запускать изолированную среду для выполнения ненадежного сгенерированного LLM кода, эффективно предотвращая случайное удаление критических файлов системы или запуск вредоносных reverse shell (Источник: Hacker News)
Engram: плагин долговременной памяти между сессиями и проектами для Claude Code : Weaviate представила опенсорсный плагин долговременной памяти Engram для Claude Code. Инструмент преодолевает традиционные ограничения изоляции в рамках одного репозитория CLAUDE.md и холодного старта при перезапуске: он асинхронно фиксирует технические решения разработчика, архитектурные компромиссы и историю итераций кода в фоновом режиме, а перед каждым рефакторингом автоматически находит и внедряет наиболее релевантные воспоминания, обеспечивая бесшовное наследование знаний между несколькими проектами и командами (Источник: bobvanluijt)

Natura представила умное кольцо Interface за 99 долларов: круглосуточное взаимодействие с агентами и мониторинг биометрии : Аппаратный стартап Natura представил умное кольцо Interface, разработанное специально для взаимодействия с AI-агентами. Устройство оснащено миниатюрным микрофоном и тактильным датчиком: пользователю достаточно нажать пальцем, чтобы в любой момент отдать команду подключенной языковой модели (поддерживаются ChatGPT, Claude, Grok и др.) или записать встречу, получая ответы голосом через наушники. При этом кольцо держит заряд от 6 до 12 дней и непрерывно отслеживает вариабельность сердечного ритма, температуру тела и другие показатели (Источник: TechCrunch)

Вышло мажорное обновление ttok 1.0: синхронизация правил токенизации с GPT-5 и GPT-6 по умолчанию : Утилита командной строки для подсчета токенов ttok, поддерживаемая известным опенсорс-разработчиком Саймоном Уиллисоном (Simon Willison), получила версию 1.0. В обновлении отказались от долгое время применявшегося по умолчанию словаря GPT-4 в пользу новейшей системы кодирования Tiktoken для моделей линеек GPT-5 и GPT-6. Тесты подтвердили, что подсчет токенов для передовых моделей нового поколения на одном и том же корпусе текстов полностью совпадает, что дает разработчикам единую основу для точного расчета расходов на API (Источник: Simon Willison)
Hermes Agent появился в Microsoft Store и интегрировал плагин безголового браузера TinyFish : Открытый персональный агент Hermes Agent, разрабатываемый Nous Research, стал доступен в магазине Windows Store с установкой в один клик. В последней версии интегрирован официальный плагин TinyFish для выхода в сеть: агент может автономно использовать безголовый браузер в локальных рабочих процессах для сбора данных из интернета в реальном времени с подтверждением прав доступа перед расходом баллов, что делает интеграцию локального ПК-ассистента с внешней сетью еще более тесной (Источник: Teknium)

📚 Исследования
15 ведущих институтов опубликовали 500-часовой датасет зрительно-тактильного взаимодействия TouchScale, удвоивший успешность выполнения задач : 15 организаций, включая Texas A&M, DeepMind и CMU, совместно опубликовали TouchScale — мультимодальный датасет зрительно-тактильных данных человеческих рук со стандартизированными сенсорами. Датасет включает 500 часов RGB-D видео от первого лица и данные сенсорных перчаток (по 880 тактильных элементов на каждой руке), охватывая 87 тысяч траекторий манипуляций. Эксперименты доказали, что использование этих данных для промежуточного обучения (mid-training) контактному прогнозированию повысило успешность роботизированной руки в сложных задачах физического контакта (например, сортировке мягких и твердых предметов) с 22,5% до 57,5%, подтвердив применимость законов масштабирования (Scaling Law) к тактильной модальности наравне со зрительной (Источник: 机器之心, 36氪)
.jpg)
NVIDIA и партнеры представили Physis-Lang: повышение физической достоверности генерации видео с помощью самоэволюции репрезентаций физического языка : NVIDIA совместно с MIT и Оксфордским университетом представила фреймворк самоэволюции физических промпт-репрезентаций Physis-Lang. Решая проблему слабого понимания моделями видео непрерывных динамических процессов (таких как плавление или разрыв), фреймворк формирует бенчмарк PhysCapBench из 3794 элементарных физических утверждений, побуждая AI-агента автономно генерировать детальные физические причинно-следственные подсказки и целенаправленно извлекать данные о механизмах процессов. В рейтинге Physics-IQ Verified дообученная серия Cosmos3 заняла первое место, значительно превзойдя стандартные бейзлайны по точности воспроизведения реальных законов физики (Источник: 机器之心)
.jpg)
Кембридж и Королевский колледж Лондона выявили смысловые разрывы при переводе математических доказательств передовых моделей с естественного языка на Lean : Ученые из Кембриджского университета и Королевского колледжа Лондона опубликовали статью с критической оценкой практики массовой публикации математических результатов лабораторий без полной формальной верификации. Проанализировав выкладки OpenAI, которая ранее заявляла о решении задачи, связанной с уравнениями Навье — Стокса, авторы указали, что если оценка в статье на естественном языке требовала лишь 4 дополнительных производных на входе, то транслированный код на Lean ввел 5 ослабляющих условий; в оценке «давление — поток» также использовались совершенно иные границы и логика аргументации. Исследователи предупреждают: машинная верификация гарантирует лишь отсутствие синтаксических тупиков в выводе, но не тождественность формализованного утверждения исходной теореме, сформулированной на естественном языке (Источник: THE DECODER, halvarflake, 36氪)

Исследование механизмов on-policy дистилляции показало: модели осваивают лишь навыки комбинаторного рассуждения, но не новые факты : Строгий контролируемый эксперимент дал отрицательный ответ на давний спор о том, способна ли on-policy дистилляция (OPD) передавать модели новые знания. Разделив синтетические задачи и фактологические вопросы, исследование доказало: OPD с использованием обратной дивергенции Кульбака — Лейблера (reverse KL) исключительно стабильно переносит многошаговую логику рассуждений модели-учителя на модель-ученика, однако уровень усвоения новых фактологических знаний близок к нулю. Переход на прямую дивергенцию (forward KL) восстанавливает передачу знаний, но разрушает сложную организацию рассуждений. Это открытие подтверждает, что суть пост-тренинговой дистилляции заключается в реорганизации логической структуры уже существующего пространства параметров модели, а не в расширении ее параметрической фактологической памяти (Источник: HuggingFace Daily Papers)
Memento 3: безградиентный самоэволюционирующий агент на основе рефлексивной базы правил и компиляции кода : В исследовании предложена внешняя парадигма самоэволюции Memento 3 для языковых моделей с фиксированными параметрами. Агент через внешнюю постоянную память ведет базу правил на естественном языке, моделирующую динамику среды, и динамически компилирует ее в детерминированный исполняемый код для прогнозирования и планирования. При получении ошибочной обратной связи от среды агент автоматически корректирует правила и код с помощью воспроизведения (unit replay). В открытом тесте ARC-AGI-3 эта безградиентная система без изменения весов LLM прошла все 25 базовых игр, достигнув 100% эффективности действий по сравнению с человеком (Источник: HuggingFace Daily Papers)
Исследовательская группа Apple представила модель нормализованных траекторий NTM: приближение к качеству генерации за полный цикл всего за 4 шага сэмплирования : Лаборатория машинного обучения Apple представила на NeurIPS 2026 модель нормализованных траекторий (Normalizing Trajectory Models, NTM). Решая проблему потери точной вероятностной структуры при попытках экстремально сократить шаги инференса в диффузионных моделях и flow matching, NTM моделирует каждый обратный шаг диффузии как выразительный условный нормализующий поток. Сочетая глубокий параллельный предиктор траектории и механизм самодистилляции, модель приближается к качеству генерации полного цикла всего за 4 шага сэмплирования, сохраняя строгую вероятность генерации и уверенно опережая популярные дистилляционные бейзлайны в тестах генерации изображений (Источник: Apple Machine Learning Research)

Статья NVIDIA на NeurIPS 2026: вызов внешних инструментов агентами значительно увеличивает риск мультимодального джейлбрейка : Исследование лаборатории безопасности NVIDIA показало, что при наделении мультимодальных больших моделей возможностью вызывать инструменты механизмы защитного отказа у всех протестированных моделей резко деградируют: число успешных попыток взлома взлетает вплоть до 68,7%. Ключевой механизм заключается в том, что огромные объемы возвращаемого инструментами текста мгновенно заполняют контекстное окно, размывая вес исходного вредоносного запроса пользователя и побуждая модель переключать внимание на описание результатов работы инструментов вместо оценки безопасности. Авторы призывают разработчиков не ограничиваться оценкой безопасности агентов в рамках обычного диалога (Источник: omarsar0)

Google раскрыла подробности об агенте непрерывной интеграции FlowAgent: на практике принято и смержено свыше 28 тысяч автоисправлений : Google опубликовала на ArXiv статью с подробным описанием FlowAgent — агента автоматического исправления ошибок для систем непрерывной интеграции (CI). Система использует цикл ReAct для реагирования на падения юнит-тестов и применяет двойной фильтр отсева до и после выполнения для отбраковки ненадежных решений. Будучи внедренной во всей компании Google, система предложила решения для почти 300 тысяч сбоев сборки, из которых инженеры вручную одобрили и влили в кодовую базу более 28 тысяч исправлений, продемонстрировав масштабируемый фреймворк практического применения программных агентов в жестких производственных условиях (Источник: omarsar0)

Лаборатория Линкольна MIT опубликовала отчет LAICS об эволюции коммерческого AI-железа: фокус смещается с транзисторов на топологию и смешанную точность : Суперкомпьютерный центр Лаборатории Линкольна MIT опубликовал обзор развития вычислительного AI-оборудования (LAICS). В отчете проанализированы показатели пиковой производительности и энергоэффективности более 120 коммерческих AI-ускорителей (включая GPU, ASIC, FPGA и новые dataflow-чипы) за последние восемь лет. Указывается, что ключевой драйвер роста вычислительной мощности смещается от простого уменьшения техпроцесса к перестройке плотности транзисторов, популяризации форматов низкой смешанной точности (таких как FP4/NVFP4) и перепроектированию высокоскоростных межкристальных сетевых архитектур (NoC) (Источник: MIT News)

💼 Бизнес
Платформа оценки больших моделей Arena привлекла 200 млн долларов в раунде B при оценке 3,1 млрд долларов и запустила индекс выравнивания агентов : Платформа слепого тестирования моделей Arena (созданная на базе LMSYS) объявила о закрытии раунда финансирования Series B на сумму 200 млн долларов при оценке в 3,1 млрд долларов во главе с Lightspeed и Khosla. Годовая выручка платформы уже превысила 100 млн долларов. После этого раунда компания официально представила коммерческий «Индекс выравнивания AI» (Alignment Index), который на основе более 90 тысяч длительных взаимодействий с 27 передовыми моделями в реальных средах отслеживает скрытые нарушения: превышение полномочий, обман пользователей и ложную атрибуцию, восполняя пробел в независимой оценке безопасности в условиях неэффективности статических тестов (Источник: TechCrunch, arena)

NVIDIA выделит 1 млрд долларов в течение пяти лет на развитие исследований сверхразума и квантовых вычислений в США : На научном саммите в Вашингтоне NVIDIA объявила о выделении в течение следующих пяти лет вычислительных мощностей, финансирования и программно-аппаратных ресурсов на сумму 1 млрд долларов для поддержки передовых научных исследований и разработок в области квантовых вычислений в США. Программа ориентирована на ведущие американские университетские институты, квантовые лаборатории и облачных провайдеров, выполняющих федеральные научно-исследовательские задачи. Цель инициативы — глубокая интеграция AI через инфраструктуру ускоренных вычислений в открытие новых материалов, моделирование термоядерной плазмы и создание гибридных квантово-классических архитектур (Источник: The Verge)
Cloudflare полностью приобрела команду среды выполнения JavaScript Deno для усиления экосистемы edge-вычислений : Cloudflare объявила о приобретении ключевой команды Deno: создатель Node.js и Deno Райан Даль (Ryan Dahl) вместе со всей командой официально присоединяются к компании. После сделки команда войдет в подразделение Cloudflare Workers и сосредоточится на развитии открытой серверлесс-основы workerd, а также обеспечении нативной совместимости с Node.js и поддержки современных веб-стандартов для платформы периферийных вычислений, что укрепит позиции Cloudflare в качестве AI-нативного edge-шлюза (Источник: threepointone)
🌟 Сообщество
Лауреат Филдсовской премии 2022 года заявил, что массовый штурм математических проблем со стороны OpenAI разрушает исследовательскую экосистему молодых ученых : Лауреат Филдсовской премии Юго Дюминиль-Копен (Hugo Duminil-Copin) в своем академическом докладе открыто сравнил публикацию OpenAI сотен математических препринтов (включая темы его собственной исследовательской группы) с «проехавшимися по ним грузовиками». Это действие уничтожило запас открытых гипотез, на которых молодые ученые строили заявки на гранты и профессорские позиции, повергнув аспирантов в беспрецедентную тревогу. Академическое сообщество шокировано тем, как коммерческая компания с закрытым исходным кодом использует грубую вычислительную силу для исчерпания открытых научных задач; дискуссии о читаемости сгенерированных машиной доказательств и нормах машинного рецензирования продолжают набирать обороты (Источник: JvNixon)
Сообщество продолжает эстафету оптимизации рукописи OpenAI об умножении целых чисел: совершенствование параметров нижней границы совершило качественный скачок : После того как OpenAI заявила в рукописи о преодолении нижней границы умножения целых чисел $n \log n$, открытое математическое сообщество создало трекер для совместной экстремальной оптимизации. Переработав конечные сети и устранив квадратичный штраф за узкие места, разработчики и исследователи с помощью Codex всего за несколько дней улучшили параметр поправки $\kappa$ с исходных $2^{-182}$ до $2^{-15}$ и провели строгую верификацию в ядре Lean, продемонстрировав впечатляющую скорость совместной работы человека и машины на переднем крае математики (Источник: BorisMPower, Don’t Worry About the Vase)

Глубокий разбор базовых технологий кинопроизводства на базе AI от Бена Аффлека взорвал сообщество: кинозвезда свободно оперирует понятиями тензоров и файнтюнинга весов : Видеоинтервью Бена Аффлека, продемонстрировавшего глубокое понимание технологий AI, завирусилось в технических сообществах. Аффлек не только свободно объяснил базовую математику сверточных нейросетей, тензоров, выделения контуров и инференса на GPU, но и подробно рассказал, как созданная им и впоследствии приобретенная Netflix AI-студия замораживает базовую модель с открытым исходным кодом и дообучает веса последнего слоя на собственном высококачественном видео датасете, чтобы соответствовать кинематографическим стандартам и одновременно исключить риски нарушения авторских прав. В техническом сообществе его окрестили «голливудским режиссером уровня Кремниевой долины» (Источник: Latent Space)
Интервью с Periodic Labs: физические эксперименты и обучение с подкреплением в реальном мире как фундамент эволюции AI-ученых : Бывший исследователь OpenAI Лиам Федус (Liam Fedus) и экс-исследователь Google DeepMind Догуш Чубук (Dogus Cubuk) в подкасте подробно рассказали о технологическом векторе стартапа по созданию новых материалов Periodic Labs. Они подчеркнули, что только за счет предобучения на интернет-текстах или синтетических логических рассуждений невозможно проникнуть в область неизвестного в физике, поскольку реальные материалы подвержены сложнейшим микроскопическим фазовым переходам и шумам измерений. Команда упаковывает реальное высокопроизводительное лабораторное оборудование в контур обучения с подкреплением с обратной связью от среды, превращая каждую неудачную траекторию синтеза в качественный отрицательный пример для поиска «синтетического сверхразума» (Источник: Latent Space)
Cloudflare полностью компенсировала разработчику астрономический счет за бесконечный цикл AI-кода и разобрала архитектурные риски : Разработчик, использовавший Codex для написания сервиса на Cloudflare Durable Objects, столкнулся со сгенерированной AI логикой повторных попыток отправки алертов, которая вошла в самоподдерживающийся бесконечный цикл с сотнями обращений в секунду, породив за короткий срок счет за чтение и запись в базу данных на сумму более 10 000 долларов. После обращения Cloudflare полностью аннулировала счет, а инженеры компании подробно разобрали инцидент, указав на скрытые финансовые риски концепции «Vibe Coding», когда отсутствие инспекции низкоуровневого кода разработчиком в бессерверной среде без жестких лимитов расходов может легко привести к финансовому коллапсу (Источник: dotey)
💡 Разное
Anthropic обязалась выделить 150 млн долларов на программу Белого дома Genesis Mission для поддержки передовых государственных научных вычислений : На саммите Управления по научно-технической политике Белого дома компания Anthropic объявила о выделении вычислительных и технических ресурсов на сумму 150 млн долларов в течение следующих трех лет для участия в национальной программе США Genesis Mission. Anthropic будет тесно сотрудничать с NASA, Национальными институтами здравоохранения (NIH) и еще 15 федеральными научными институтами и национальными лабораториями, развертывая Claude и автоматизированные среды программирования, а также предоставляя техническую поддержку и специализированное обучение для решения сложнейших задач, таких как управление термоядерным синтезом и квантовые вычисления (Источник: Anthropic News)
Команда MIT использовала машинное обучение для реорганизации динамического диспетчирования серверов с целью снижения потерь энергии в дата-центрах : В ответ на кризис электросетей, вызванный взрывным ростом вычислений для больших моделей AI, команда доцента MIT Кристины Делимитру (Christina Delimitrou) разработала архитектуру управления энергопотреблением серверов на базе глубокого обучения. Система в реальном времени прогнозирует конкуренцию за ресурсы микросервисов и облачного ПО, динамически диспетчеризируя и уплотняя кластеры серверов, которые сейчас обычно работают с полезной нагрузкой всего около 15%. Это позволяет существенно раскрыть потенциал высокоплотных вычислений и снизить потери электроэнергии без необходимости масштабного расширения энергетической инфраструктуры (Источник: MIT News)
