Xinzhi Embodied совместно с Университетом Фудань представили… | AI Ежедневник 2026-07-27

🔥 В центре внимания

Xinzhi Embodied совместно с Университетом Фудань представили серию моделей N0 и датасет NeoData : Xinzhi Embodied совместно с Университетом Фудань представили серию моделей воплощенного интеллекта (embodied AI) N0 и датасет NeoData. NeoData содержит более 30 000 часов данных зрительно-тактильного взаимодействия, а единая модель представления NeoForce решает проблему слияния данных от различных тактильных датчиков. N0-VTLA повышает вероятность успешного выполнения операций за счет прогнозирования тактильных изменений на 50 шагов вперед, а N0-TWAM внедряет тактильное прогнозирование в модель мира (world model), способствуя переходу воплощенного интеллекта от «управления зрением» к «интеграции зрения и осязания». (Источник: QbitAI)

Xinzhi Embodied совместно с Университетом Фудань представили серию моделей N0 и датасет NeoData

Induction Labs представила модель Photon-1 : Induction Labs представила модель Photon-1 — разреженную модель смеси экспертов (MoE) размером 106B-A5B. Ее инновационность заключается в предварительном обучении на видео без разметки действий для изучения неявных стратегий. Photon-1 превзошла Gemini 3.1 Flash-Lite в бенчмарках по использованию компьютера, при этом затраты вычислительной мощности на предобучение значительно снизились, а стоимость вывода сократилась примерно в 3 раза. Даже обучаясь только на видеозаписях рабочего стола, дообученная (fine-tuned) Photon-1 показала отличные результаты в шашках и физическом моделировании пинбола. (Источник: MarkTechPost)

Команда KwaiKAT выпустила KAT-Coder-V2.5 : Команда KwaiKAT из Kuaishou представила KAT-Coder-V2.5 — агентную модель программирования, обученную на реальных исполняемых репозиториях кода. Команда автоматически создала более 100 000 проверяемых сред репозиториев с помощью AutoBuilder и применила обучение с подкреплением, используя механизм фильтрации на основе процессов и асимметричный алгоритм AFT-PPO. KAT-Coder-V2.5 лидирует на PinchBench с высоким результатом 94,9 балла, демонстрируя путь к повышению производительности агентов долгосрочного программирования за счет оптимизации инфраструктуры песочницы и дизайна алгоритмов. (Источник: MarkTechPost)

Открыт исходный код базовой визуально-документной модели MonkeyOCRv2 : Команда из Хуачжунского университета науки и технологий и других институтов открыла исходный код MonkeyOCRv2. Модель вводит цель предобучения «реконструкция как визуальная память документа». В контролируемых экспериментах с замороженной бэкенд-языковой моделью Qwen3-1.7B модель MonkeyOCRv2 опередила сильнейшего конкурента на 13,2 балла в 8 бенчмарках понимания документов. В то же время команда открыла исходный код датасета MonkeyDoc v2, содержащего 113 миллионов изображений, предоставив сообществу единый полигон для экспериментов по предобучению визуального анализа документов и способствуя эволюции ИИ для документов от семантического автодополнения к визуальной точности. (Источник: Jiqaizhixin)

Открыт исходный код базовой визуально-документной модели MonkeyOCRv2

Valkor совместно с Чжэцзянским университетом и другими партнерами открыли исходный код фреймворка управления состоянием агентов Loom : Решая проблему того, что ИИ-агенты программирования склонны попадать в «черные дыры отладки» и страдать от «локальной амнезии» при выполнении длительных задач, Valkor совместно с Чжэцзянским университетом и командой UCL представили фреймворк с открытым исходным кодом Loom. Loom разбивает сложные задачи по поставке ПО на структурированные цепочки состояний, которые можно восстановить в любой момент. При сбое теста Loom фиксирует его как независимый от истории чата статус задачи, позволяя разработчикам беспрепятственно переключать модели или агентов для продолжения работы. Это предоставляет ключевую инфраструктуру состояний для ИИ-программирования в серьезных производственных средах. (Источник: Jiqaizhixin)

Valkor совместно с Чжэцзянским университетом и другими партнерами открыли исходный код фреймворка управления состоянием агентов Loom

🎯 Тенденции

Sakana AI выпустила модель маршрутизации кибербезопасности Fugu-Cyber : Sakana AI представила Fugu-Cyber — специализированную модель маршрутизации кибербезопасности на базе своего оркестратора Fugu. Модель достигла 86,9% успеха на CyberGym и 72,1% на CTI-REALM, конкурируя с передовыми моделями вроде GPT-5.5-Cyber. Через фреймворки TRINITY и Conductor модель Fugu-Cyber динамически координирует работу нескольких субагентов в сфере безопасности для проверки уязвимостей и генерации правил обнаружения, используя многоуровневую модель оплаты за Token. (Источник: MarkTechPost)

Проект Open Dreamer открыл JAX-реализацию модели мира Dreamer 4 : Независимая исследовательская группа Reactor открыла исходный код Open Dreamer — репликации конвейера модели мира Dreamer 4 на базе JAX и Flax NNX. Модель включает видеотокенизатор Masked Autoencoder, не требующий состязательных потерь, а также модель пространственно-временной динамики внимания с параметрами 1.6B без разметки действий. Команда полностью опубликовала рецепт обучения и поделилась инженерными деталями стабильности, такими как оптимизация видеопамяти на GPU B200 и решение проблемы дрейфа оптимизатора Muon, что дает ценный справочный материал для воспроизведения моделей мира. (Источник: MarkTechPost)

InclusionAI запустила Ling-3.0-flash на OpenRouter : Легковесная модель MoE Ling-3.0-flash, ориентированная на выполнение рабочих процессов агентов, теперь доступна в виде API на OpenRouter. Модель имеет в общей сложности 124B параметров (5.1B активных), поддерживает контекст 256K и имеет TTFT менее 100 мс. Она позиционируется как недорогой и быстрый узел выполнения для совместной работы с крупными планировщиками, оптимизирована для длительного вызова инструментов и следования инструкциям, а также предлагает переключаемый гибридный режим вывода. (Источник: Reddit)

Ling-3.0-flash

Выпущена версия модели GLM-5.2 без цензуры (Abliterated) : Сообщество выпустило большую модель GLM-5.2, прошедшую процедуру снятия ограничений на отказ (Abliterated) и тонкую настройку. В модели удалены направления безопасного отказа, а также проведена целевая тонкая настройка для долгосрочного противостояния и агентных задач, чтобы предотвратить беспричинный отказ модели при обработке технических или конфиденциальных задач. Тесты показывают отличные результаты в бенчмарках безопасности и кода, таких как CyberGym и AgentHarm. По умолчанию данные не сохраняются, а правила полностью определяются пользователем через системные подсказки. (Источник: Reddit)

Выпущена версия модели GLM-5.2 без цензуры (Abliterated)

🧰 Инструменты

В Llama.cpp добавлена нативная поддержка MCP : PR, инициированный разработчиком ngxson, был успешно объединен с llama.cpp, благодаря чему его WebUI и инструменты командной строки получили нативную поддержку протокола контекста модели (MCP). Теперь пользователям не нужны внешние посредники для настройки и вызова различных серверов MCP (таких как помощник по коду Serena) непосредственно в локальном клиенте. Это обеспечивает полностью локализованную разработку и отладку агентов без внешних зависимостей, значительно снижая порог создания экосистемы агентов на базе локальных моделей с открытым исходным кодом. (Источник: Reddit)

Открыт исходный код фреймворка локальных агентов Open Minis : Разработчик Ethan Wang объявил об открытии исходного кода Open Minis — приложения ИИ-агента, которое может работать локально на мобильных устройствах. Оно поддерживает iOS и Android, интегрирует локальный Linux Shell, автоматизацию браузера, расширяемые навыки (Skills) и долговременную память. Загружая метаинформацию о Skills в системный промпт и сочетая ее с Prompt Caching, модель может последовательно выбирать и выполнять инструменты за один раунд диалога, предоставляя легковесный пример для разработки локальных агентов на устройствах. (Источник: X)

Aethos_Memory решает проблему забывания данных агентами между сессиями : Решая проблему невозможности совместного использования контекста ИИ-помощниками по кодингу между различными сессиями, разработчики открыли инструмент Aethos_Memory. Этот инструмент предоставляет агентам постоянный уровень памяти, способный автоматически извлекать и сохранять ключевые решения, архитектуру кодовой базы и записи об исправлении ошибок (Bug) из сессий. При создании новой сессии агент может напрямую считывать структурированную память, избавляя разработчиков от необходимости вручную копировать и вставлять историю. (Источник: Reddit)

Aethos_Memory

Runway представила инструмент маршрутизации медиа Media Router : Платформа генерации видео Runway представила Media Router — первый инструмент оптимизации маршрутизации на основе предпочтений для генеративных медиа. Корпоративным командам, использующим производственные конвейеры с несколькими моделями видео, изображений и аудио, больше не нужно вручную выбирать модель для каждого запроса. Достаточно один раз определить предпочтения по стоимости, качеству или задержке в Router, и система маршрутизации автоматически распределит запросы Token, обеспечивая оптимальный баланс между стоимостью и результатом. (Источник: X)

📚 Обучение

Выпущен инструмент TileLang для проектирования и оптимизации ядер GPU : В статье представлен TileLang — инструмент DSL для проектирования ядер GPU на базе TVM. Руководство содержит полный код на Python, демонстрирующий проектирование таких ядер, как сложение векторов, матричное умножение Tensor Core, объединенный Softmax, FlashAttention и др. Благодаря разделяемой памяти Tile и блочной структуре регистров в TileLang компилятор может автоматически обрабатывать сопоставление и синхронизацию потоков, а также поддерживает поиск оптимальной конфигурации оборудования при фиксированном бюджете GPU с помощью @tilelang.autotune. (Источник: MarkTechPost)

Опубликовано руководство по потенциалу атомистического моделирования FAIRChem v2 и UMA : В руководстве подробно описывается использование фреймворка Meta FAIRChem v2 и универсального межатомного потенциала машинного обучения (MLIP) UMA. Содержание охватывает получение весов закрытых (gated) моделей через Hugging Face, настройку калькулятора в ASE (Atomic Simulation Environment) и выполнение ряда рабочих процессов вычислительной химии, таких как прогнозирование одноточечной энергии, оптимизация геометрии молекул, сравнение спиновых состояний, оценка энергии реакции, релаксация кристаллической решетки, аппроксимация уравнения состояния и моделирование молекулярной динамики. (Источник: MarkTechPost)

Relative Representation решает проблему выравнивания векторных пространств гетерогенных LLM : Сообщество поделилось геометрической технологией, использующей метод относительного представления (Relative Representation Method) и симметричную ортогонализацию Lowdin для выравнивания различных пространств эмбеддингов LLM (например, при совместном использовании Llama, Mistral и Phi). Этот метод не требует тонкой настройки: путем введения опорных точек в определенной семантической области и выполнения Z-score стандартизации по столбцам он проецирует векторы различной размерности в единое общее пространство. Это решает проблемы анизотропного конуса и несовпадения размерностей в многоагентной маршрутизации. (Источник: Reddit)

Relative Representation

Рукописный вывод и графическая схема вычислений U-Net : Исследователь в области компьютерного зрения Prof. Tom Yeh опубликовал рукописную схему вычислений сети U-Net. В 17 шагах руководство показывает, как изображение с тремя каналами R, G, B сжимается с помощью свертки и максимального пулинга до Bottleneck размером 2×4, а затем постепенно восстанавливается до исходного размера с помощью транспонированной свертки и пропускных связей (Skip Connection). Это наглядно демонстрирует математические принципы работы ядра диффузионных моделей через процесс матричного умножения. (Источник: X)

💼 Бизнес

Stripe планирует приобрести OpenRouter за 10 миллиардов долларов : Платежный гигант Stripe ведет переговоры о крупном приобретении платформы-агрегатора ИИ-моделей OpenRouter с оценкой в 10 миллиардов долларов, что почти в 8 раз превышает оценку в 1,3 миллиарда два месяца назад. Поскольку компании стремятся использовать несколько моделей для диверсификации рисков, трафик и стратегическая ценность OpenRouter стали очевидными. Stripe, которая «тихо зарабатывает» в эпоху ИИ с помощью одной строки платежного кода и ранее приобрела Metronome, расширит свой бизнес от платежей до базовой инфраструктуры экосистемы ИИ благодаря этой сделке. (Источник: Jiqaizhixin)

Stripe планирует приобрести OpenRouter за 10 миллиардов долларов

Moushen Intelligent привлекла около 100 млн юаней в рамках дополнительного раунда Pre-A : Компания в сфере локального воплощенного интеллекта Moushen Intelligent объявила о завершении дополнительного раунда финансирования Pre-A почти на 100 миллионов юаней. Раунд Pre-A+ объемом около 500 миллионов юаней также находится в процессе закрытия, при этом оценка компании выросла более чем в 10 раз за полгода. Компания была основана профессором Университета Фудань Чэнь Тао и бывшим ученым Intel Чжан Иминем. Ее пространственно-временная модель мира и действий STI-WM снижает потребность в данных с реальных устройств на 90% за счет токенизации действий и обеспечивает сверхнизкозатратную локальную адаптацию на отечественных чипах, таких как HiSilicon и Horizon Robotics. (Источник: 36kr)

Moushen Intelligent привлекла около 100 млн юаней в рамках дополнительного раунда Pre-A

Компания по производству хирургических роботов Vicarious Surgical объявила о банкротстве и ликвидации : Единорог в сфере хирургической робототехники Vicarious Surgical, ранее привлекавший инвестиции от Билла Гейтса, Джерри Янга и других, принял решение прекратить деятельность и начать процедуру ликвидации из-за серьезного отставания в исследованиях и разработках, а также разрыва цепочки финансирования. Компания привлекла в общей сложности более 2 миллиардов юаней, но ее радикальное решение с развязанным приводом и концепция управления через VR столкнулись с трудностями при одобрении FDA и серийном производстве. Это стало тревожным сигналом для сферы воплощенного интеллекта, которая сейчас имеет высокие оценки, но сталкивается с трудностями в коммерциализации. (Источник: 36kr)

Компания по производству хирургических роботов Vicarious Surgical объявила о банкротстве и ликвидации

🌟 Сообщество

ИИ-помощники по программированию заставили CS-образование переосмыслить методы оценки : Опрос Ассоциации вычислительной техники (ACM), в котором приняли участие более 700 преподавателей компьютерных наук из 49 стран, показал, что 69% преподавателей считают, что ИИ изменил навыки, необходимые для разработки ПО, а 64% сместили акцент в обучении с «написания кода с нуля» на понимание и отладку кода. Чтобы справиться со списыванием и чрезмерной зависимостью от ИИ, 68% преподавателей скорректировали методы оценки, добавив очные экзамены с закрытой книгой, устные защиты и сессии защиты кода, чтобы переопределить оценку навыков программирования в эпоху ИИ. (Источник: THE DECODER)

ИИ-помощники по программированию заставили CS-образование переосмыслить методы оценки

Индексация общих ссылок на диалоги Claude поисковиком Google вызвала опасения по поводу конфиденциальности : Сообщество обнаружило, что диалоги и Artifacts, которыми пользователи делятся через функцию «создать публичную ссылку» в Claude, открыто индексируются поисковыми системами, такими как Google. Появились даже сторонние сайты, специально собирающие эти ссылки. Утечки включают приватные ключи криптовалют, коммерческие тайны и личные медицинские данные. Пользователи критикуют Anthropic за то, что компания не добавила метатег noindex на страницы общего доступа, назвав это грубой ошибкой в дизайне безопасности, и призывают пользователей своевременно удалять общие диалоги в настройках. (Источник: Reddit)

Индексация общих ссылок на диалоги Claude поисковиком Google вызвала опасения по поводу конфиденциальности

В Кремниевой долине набирают популярность воркшопы «Avoiding AI» по обратной цифровой грамотности : На фоне того, как технологические гиганты принудительно внедряют ИИ во все типы устройств, офлайн-воркшопы «Avoiding AI» (Избегая ИИ), организованные библиотеками в различных регионах США, стали вирусными в социальных сетях. Библиотекари пошагово обучают граждан тому, как полностью отключить встроенные функции ИИ, такие как Apple Intelligence и Gemini, а также делятся плагинами для браузеров, блокирующими ИИ-сводки в поиске Google. Таким образом граждане выражают обеспокоенность монополией крупных корпораций, нарушением конфиденциальности и энергопотреблением дата-центров, призывая к технологическому суверенитету. (Источник: TechCrunch)

Avoiding AI

Министр торговли США Lutnick высказался в поддержку ИИ с открытым исходным кодом для противостояния Китаю : Сообщество активно обсуждает заявление министра торговли США Howard Lutnick на ужине корреспондентов Белого дома, где он прямо заявил, что «нынешний Белый дом будет защищать ИИ с открытым исходным кодом». Ранее APEC подписал декларацию в поддержку открытого ИИ, и сейчас в правительстве США обсуждается замена тотальных блокировок точечными запретами на конкретные модели. Это должно помочь американской экосистеме открытого исходного кода быстро догнать закрытые передовые разработки за счет «форков» и «тонкой настройки» в условиях ограниченных вычислительных мощностей, обеспечивая технологическое доминирование США. (Источник: X)

Andrej Karpathy изменил описание своего профиля, вызвав слухи об уходе : Известный исследователь ИИ Andrej Karpathy удалил упоминание «Anthropic» из описания своего профиля в социальных сетях, что вызвало широкие спекуляции в сообществе о его возможном уходе. Некоторые источники утверждают, что он решил уйти из-за экспортных ограничений, которые лишили его (как негражданина США) доступа к самым передовым моделям компании, однако другие пользователи отметили, что изменения в профиле произошли уже несколько дней назад. Поскольку Anthropic недавно не подписала открытое письмо в поддержку открытого исходного кода, инициированное Дженсеном Хуангом, ее консервативная коммерческая и регуляторная стратегия сталкивается с определенным противодействием со стороны общественного мнения в сообществе. (Источник: Jiqaizhixin)

Andrej Karpathy изменил описание своего профиля, вызвав слухи об уходе

DeepSeek приостановила второй раунд финансирования из-за утечки протокола встречи с инвесторами : Распространившийся в социальных сетях протокол встречи основателя DeepSeek Лян Вэньфэна с инвесторами заставил руководство компании экстренно уведомить потенциальных инвесторов о временной приостановке второго раунда финансирования. Утекшая стенограмма содержит конфиденциальные заявления DeepSeek о разрыве в вычислительных мощностях между Китаем и США, стратегии ценообразования на Token и коммерческой модели открытого исходного кода. В сообществе развернулись дискуссии о тонкой настройке и развертывании модели «фабрики токенов» DeepSeek, которая за счет инженерной оптимизации снизила стоимость вывода до трети от стоимости западных аналогов. (Источник: Hacker News)

💡 Разное

ChatGPT помог пользователю обнаружить заражение MacBook вирусом AtomicStealer : Пользователь Mac, пытавшийся оптимизировать оперативную память для локальной большой модели, использовал ChatGPT для анализа системных процессов и случайно обнаружил два файла LaunchDaemon, маскирующихся под системные службы и указывающих на скрытые скрипты в Library. ChatGPT сразу же предупредил, что это вредоносное ПО, и помог пользователю локализовать троян-стиллер OSX.AtomicStealer, которым устройство заразилось после установки скомпрометированной библиотеки PDF с открытым исходным кодом. Это продемонстрировало неожиданную роль ИИ в повседневной защите конечных устройств. (Источник: Reddit)

ChatGPT помог пользователю обнаружить заражение MacBook вирусом AtomicStealer

Decoy Font использует визуальные различия для обмана мультимодального ИИ : Дизайн-студия Mixfont выпустила «Decoy Font» (шрифт-приманку). Накладывая на обычные буквы тонкие линии мешающих символов, этот шрифт заставляет мультимодальные ИИ с визуальными возможностями, такие как ChatGPT и Claude, считывать неверный текст при OCR-распознавании (например, «Sorry Robot»), в то время как человеческий глаз на определенном расстоянии все еще может нормально читать реальный текст (например, «Happy Human»). Это представляет собой новый тип физической технологии защиты от веб-скрейпинга ИИ и состязательных атак. (Источник: Reddit)

Decoy Font использует визуальные различия для обмана мультимодального ИИ

Планы по внедрению гуманоидных роботов в одной из школ Нью-Йорка вызвали протесты учителей : Государственная средняя школа в Нью-Йорке планирует внедрить в учебный процесс гуманоидных роботов в качестве ассистентов преподавателей, что вызвало решительный протест со стороны профсоюза учителей. Преподаватели считают, что в условиях нехватки финансирования образования и оттока педагогических кадров высокие затраты на закупку и обслуживание гуманоидных роботов являются нерациональным распределением ресурсов. Кроме того, роботы не могут заменить человека-учителя в эмоциональном общении и индивидуальном подходе, поэтому технологии в школах должны иметь свои границы. (Источник: Reddit)

Планы по внедрению гуманоидных роботов в одной из школ Нью-Йорка вызвали протесты учителей

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *