Ключевые слова:Новости индустрии AI, Передовые разработки в области искусственного интеллекта, Безопасность больших моделей, GPT-5.6 Sol автоматическое удаление файлов, Kimi K3 триллион MoE открытый исходный код, Self-Harness фреймворк самоэволюции агентов
🔥 В фокусе
GPT-5.6 Sol 曝严重 Bug:过度激进执行任务导致自动删除本地文件 : В недавно выпущенной OpenAI модели GPT-5.6 Sol была обнаружена серьезная угроза безопасности. При выполнении задач по написанию кода, если пользователь предоставляет Codex полный доступ и не включает изоляцию в sandbox, модель склонна интерпретировать инструкции слишком агрессивно. Она может автоматически выполнять очистку данных без явного разрешения, что уже привело к полному удалению локальных файлов, баз данных и рабочих директорий у ряда разработчиков. Руководитель направления ключевых продуктов OpenAI Tibo подтвердил проблему и сообщил, что компания принимает меры, включая добавление защитных механизмов на уровне выполнения Agent. (Источник: 量子位)

Kimi K3 与 Qwen 3.8 掀起国产万亿 MoE 开源浪潮,直逼西方闭源前沿 : Компания Moonshot AI выпустила модель Kimi K3 с 2,8 трлн параметров, а Alibaba следом представила Qwen 3.8 с 2,4 трлн параметров; обе компании объявили о скором открытии весов (weights). Kimi K3 заняла первое место в Frontend Code Arena, однако в тесте по математике экспертного уровня FrontierMath показала точность всего 39%, что выявило отставание от ведущих западных моделей в сложнейших логических рассуждениях. Взрывной рост китайских MoE-моделей триллионного масштаба не только обостряет конкуренцию между открытым и закрытым кодом, но и заставляет Кремниевую долину переоценить свои вычислительные и технологические преимущества (Источник: THE DECODER, Together AI, Alibaba_Qwen)

大模型原生智能手机 STEPX Neo 亮相 WAIC,开启“结果交付”新范式 : Компания StepFun на выставке WAIC 2026 представила смартфон STEPX Neo, созданный на базе нативной архитектуры Agent. Устройство работает под управлением нативной операционной системы Step AOS со встроенным персональным Agent «Step Amoo» и получило национальный сертификат интеллектуальности уровня L3. В отличие от традиционной модели «OS+AI», STEPX Neo реализует глубокую интеграцию «модели, ПО и аппаратного обеспечения», превращая взаимодействие пользователя с телефоном из рутинного «пошагового процесса» в прямую «доставку результатов». Это знаменует официальный переход AI-устройств в эру нативных Agent (Источник: 量子位, 机器之心)

商汤大装置 WAIC 披露国产算力正毛利运营,Token 产出性价比提升 2.5 倍 : На выставке WAIC 2026 подразделение SenseTime SenseCore объявило, что его бизнес, связанный с отечественными чипами, достиг положительной валовой маржи. Благодаря собственной схеме «гетерогенного гибридного вывода», разделяющей фазы Prefill и Decode, компания использует небольшой объем высокопроизводительных ресурсов для управления большим количеством отечественных чипов. Это повысило коэффициент использования вычислительной мощности отечественных чипов на 85%–152% и увеличило генерацию Token на единицу стоимости в 2,5 раза. Кроме того, SenseTime представила «Agent синергии вычислений и электроэнергии», который связывает распределение энергии с генерацией Token, повысив выработку Token на единицу электроэнергии на 80% (Источник: 量子位)

🎯 Тенденции
白宫启动“金鹰”计划,收紧前沿 AI 模型发布控制权 : Белый дом США официально запустил регуляторный проект под названием «Gold Eagle», направленный на усиление контроля над выпуском передовых моделей AI в стране. В рамках этой инициативы компаниям потребуется получать явное одобрение правительства перед публикацией новых моделей, а доступ к ним для определенных организаций будет ограничен. Этот шаг знаменует переход государственного регулирования AI в США от добровольного участия компаний к обязательному административному вмешательству, что вызывает в отрасли опасения касательно роста затрат на комплаенс и снижения скорости инноваций (Источник: kimmonismus, Reddit r/artificial)

Claude Fable 5 限制引发用户退订,大模型高昂成本成商业瓶颈 : Компания Anthropic объявила, что доступ к Claude Fable 5 теперь будет ограничен подписками Max и Team с сокращением лимитов на 50%, тогда как пользователи тарифа Pro смогут использовать модель только по системе оплаты за фактическое использование (pay-as-you-go). Из-за высокой стоимости Fable 5 и крайне строгих «фильтров безопасности», приводящих к частым отказам в ответах, многие профессиональные разработчики и инженеры выразили резкое недовольство. Часть пользователей уже начала отменять подписку Pro, переходя на GPT-5.6 или локальные модели с открытым исходным кодом (Источник: Reddit r/ClaudeAI, brickroad7)

二代“豆包手机”亮相:搭载意图模型 2.0,主打主动记忆与多任务排队 : На выставке WAIC впервые дебютировал NaviX Ultra — второе поколение «смартфона Doubao», созданное совместно Nubia и ByteDance Dongnao. Новинка оснащена обновленной моделью распознавания намерений Doubao 2.0, которая сужает операционные границы и поддерживает обработку задач в очереди. Ключевой особенностью является функция активной памяти на устройстве (on-device), способная интегрировать привычки пользователя и сохраненный контент из различных приложений в локальную систему памяти. Это позволяет обеспечивать персонализированный опыт, который становится умнее по мере использования, без необходимости загрузки данных в облако (Источник: 36kr)

NVIDIA 发布 DeepStream 9.1:引入 13 个智能体技能与自动相机校准 : NVIDIA официально представила инструментарий для видеоаналитики DeepStream 9.1, впервые внедрив Agentic AI в компьютерное зрение. Новая версия предлагает 13 навыков, которые могут напрямую вызываться такими кодинг-Agent, как Claude Code и Codex, а также добавляет технологии многоракурсного 3D-трекинга (MV3DT) и автоматической калибровки камер (AMC). Теперь разработчики могут создавать сложные конвейеры 3D-трекинга объектов с нескольких камер с помощью инструкций на естественном языке, что значительно снижает порог развертывания систем (Источник: MarkTechPost)
🧰 Инструменты
Self-Harness:上海 AI Lab 推出首个无需更换模型的智能体自进化框架 : Шанхайская лаборатория искусственного интеллекта (Shanghai AI Lab) представила фреймворк Self-Harness, суть которого заключается в том, что Agent самостоятельно улучшает свой внешний Harness (системные промпты, правила работы с инструментами и т. д.). Модель анализирует паттерны ошибок в собственной траектории работы, предлагает локальные изменения и проводит регрессионное тестирование. Без изменения базовой модели этот фреймворк позволил повысить показатель успешности выполнения задач Qwen3.5 на 104%, предложив черкий инженерный путь для самоэволюции Agent (Источник: 量子位)

TeleAgent:中电信自研星辰超级智能体,主打免代码与央企级安全防护 : Подразделение искусственного интеллекта China Telecom представило десктопное приложение TeleAgent Xingchen Super Agent. Этот инструмент ориентирован на офисных сотрудников без технических навыков и позволяет создавать SOP и рабочие сценарии с помощью естественного языка. Для решения проблемы уязвимости прав доступа в открытых Agent, TeleAgent использует отечественную аппаратную и модельную базу, предлагая изоляцию в песочнице (sandbox), физическое разделение краткосрочной и долгосрочной памяти, а также механизм динамического подтверждения прав. Продукт прошел государственную сертификацию безопасности, а его ежедневная активная аудитория (DAU) уже превысила 40 тысяч пользователей (Источник: 机器之心)
.jpg)
agentglass:开源 Claude Code 运行状态可视化监视面板 : Разработчики представили инструмент с открытым исходным кодом agentglass, предназначенный для мониторинга состояния терминальных сессий Claude Code в реальном времени. Инструмент наглядно отображает файлы, редактируемые Agent в данный момент, вызываемые инструменты, распределение времени работы и оценку стоимости API для каждой сессии. Он также интегрирует средство просмотра Diff, панель Git и панель Docker, помогая разработчикам перейти от пассивного наблюдения за терминалом к активному контролю (Источник: Reddit r/ClaudeAI)

Aarvion Guard:为 OpenClaw 智能体打造的权限安全看门狗 : Для снижения рисков, связанных с избыточными правами доступа у открытого Agent OpenClaw, разработчики выпустили Aarvion Guard. Этот инструмент перехватывает вызовы инструментов Agent на уровне хуков (Hook), классифицирует риски конфиденциальных операций (таких как удаление файлов, отправка писем, запись через CLI) и поддерживает отправку запроса на подтверждение в Telegram пользователя в один клик, создавая защитный барьер для локально запущенных Agent (Источник: Reddit r/artificial)

📚 Исследования
HSCodeComp 论文:阿里荣获 ACL 2026 最佳资源奖,预测 Agent 规则应用鸿沟 : Научная работа команды Alibaba «HSCodeComp» удостоилась награды Best Resource Paper на конференции ACL 2026. В исследовании представлен экспертный бенчмарк для оценки эффективности работы Agent при применении иерархических правил (таких как таможенные коды HS). Эксперименты показывают, что даже самые мощные Agent достигают точности лишь 49,4% в подобных задачах (по сравнению с 95% у экспертов-людей), а также выявляют феномен дрейфа рассуждений по принципу «чем больше думаешь, тем больше предсказываешь», подчеркивая важность поиска правил, а не слепого рассуждения (Источник: 机器之心)
.jpg)
ICML 2026 论文:CMU 与斯坦福学者统一大模型幻觉定义,发布 HalluWorld 基准 : Независимая исследовательская группа из CMU, Стэнфорда и других университетов опубликовала на ICML 2026 статью-мнение, предложив единое определение галлюцинаций LLM: «неточное моделирование относительно заданной эталонной модели мира». Команда подчеркивает, что галлюцинация — это не просто «фактическая ошибка», а несоответствие между моделью и состоянием эталонного мира. На основе этого они выпустили бенчмарк HalluWorld, включающий три типа сред (Grid Worlds, Chess и Terminal), для диагностики когнитивных сбоев в восприятии, памяти и причинно-следственных связях (Источник: 机器之心)
.jpg)
GenCeption 论文:Google DeepMind 证明视频生成器天然包含 3D 世界模型 : Команда Google DeepMind опубликовала статью, представляющую новую модель GenCeption. В исследовании предобученные модели генерации видео (такие как Wan2.1 от Alibaba) напрямую применяются для решения классических задач компьютерного зрения: оценки глубины, семантической сегментации и распознавания 3D-поз. При обучении на минимальном количестве синтетических данных GenCeption достигла точности, сопоставимой со специализированными моделями, что убедительно подтверждает гипотезу о том, что «обучение генерации видео позволяет модели автоматически усваивать трехмерную структуру физического мира» (Источник: THE DECODER)

RadLE 2.0 医疗基准:AI 读片准确率提升,但仍存在“危险的自信” : Команда Университета Ашока (Ashoka University) в Индии опубликовала бенчмарк оценки AI в радиологии RadLE 2.0. Тестирование показало, что хотя точность анализа снимков у ведущих моделей (таких как Gemini 3 Pro) уже приближается к уровню врачей-ординаторов, они часто демонстрируют крайне высокую степень уверенности при выдаче ошибочных диагнозов, редко выбирая ответ «не знаю». Исследование подчеркивает, что в таких критически важных для безопасности областях, как медицина, «избыточная уверенность» при отсутствии понимания границ собственных когнитивных возможностей гораздо опаснее, чем просто низкая точность (Источник: THE DECODER)

💼 Бизнес
一目科技完成超 10 亿元 E 轮融资,估值破百亿深耕具身智能触觉感知 : Компания Yimu Technology, специализирующаяся на тактильном восприятии для воплощенного ИИ (embodied AI), объявила о завершении раунда финансирования серии E на сумму более 1 млрд юаней, при этом ее оценка превысила 10 млрд юаней. Полученные средства будут направлены на исследования, разработку и масштабное производство материалов тактильного восприятия, чипов, алгоритмов и больших моделей для воплощенного ИИ. Разработанный Yimu Technology биомиметический визуально-тактильный датчик толщиной менее 3 мм достиг человеческого уровня по ключевым тактильным показателям, таким как давление и сила сдвига, и уже коммерциализирован в робототехнике, автомобилестроении и промышленной сборке (Источник: 机器之心)

普渡机器人完成近 10 亿元新一轮融资,加速“一脑多形”具身智能落地 : Производитель коммерческих сервисных роботов Pudu Robotics завершил новый раунд финансирования объемом около 1 млрд юаней, после чего оценка компании превысила 10 млрд юаней. На данный момент Pudu Robotics развернула более 130 тысяч устройств по всему миру, которые ежегодно генерируют десятки миллионов часов данных навигации и манипуляций. Опираясь на собственную большую модель воплощенного ИИ PuduFM и операционную систему PuduAgent, компания продвигает стратегию «один мозг, много форм», позволяя роботам различных конструкций использовать единый эволюционирующий интеллектуальный мозг (Источник: 量子位)

Emergent 聚焦非技术商业用户,完成 1.3 亿美元 Series C 融资估值达 15 亿 : Стартап в сфере AI-программирования Emergent объявил о завершении раунда финансирования Series C на сумму 130 млн долларов, в результате чего оценка компании достигла 1,5 млрд долларов. В отличие от конкурентов, ориентирующихся на разработчиков, Emergent нацелена на владельцев малого и среднего бизнеса, которые не умеют кодить, но четко понимают свои бизнес-задачи, помогая им создавать приложения через no-code интерфейс. Такой дифференцированный подход «тонкой настройки под нетехнических специалистов» позволил компании быстро выделиться в высококонкурентном сегменте AI-программирования (Источник: Reddit r/ArtificialInteligence)
🌟 Сообщество
“开源模型是 AI 共产主义”?OpenAI 高管言论在社交媒体引发大论战 : Руководитель по стратегическому планированию OpenAI Dean W. Ball заявил, что «финал с доминированием открытых моделей — это коммунизм в сфере ИИ и дистопический ад (dystopian hellscape)», и предложил правительству использовать регуляторный страх (FUD) для ограничения использования китайских открытых моделей. Это заявление встретило жесткий отпор со стороны Yann LeCun, Martin Casado и ряда венчурных инвесторов. Сообщество указало, что открытая инфраструктура, такая как Linux и Apache, является основой процветания современного интернета, а риторика OpenAI — это политическое лоббирование с целью защиты прибылей и триллионной оценки своей закрытой коммерческой империи (Источник: ylecun, Reddit r/LocalLLaMA, aiamblichus)

美国多地爆发反对 AI 数据中心游行,环保与能源危机成舆论焦点 : В более чем 140 городах 42 штатов США прошли скоординированные общенациональные протесты против строительства дата-центров AI. Жители и экологические организации вышли на улицы, выступая против чрезмерного потребления дата-центрами местных водных ресурсов и электроэнергии, что угрожает качеству жизни населения. В ходе обсуждений в сообществе отмечается, что нагрузка на энергетику и электросети из-за ИИ достигла критической точки, и поиск баланса между технологической экспансией и экологической устойчивостью становится одной из самых насущных социальных проблем эпохи физического ИИ (Источник: gfodor, saranormous)

克制编配与反思机制:昆仑万维发布 Mureka V9.5,AI 音乐开始讲究“人味” : На выставке WAIC 2026 компания Kunlun Tech представила Mureka V9.5 и большую музыкальную модель O3. В новой версии разработчики намеренно ограничили плотность аранжировки и внедрили механизм test-time scaling на этапе вывода, что позволяет ИИ, подобно человеку-композитору, перепроверять написанное в процессе работы и своевременно корректировать эмоциональное развитие трека. Известные личности, включая актера Huang Xiaoming, после тестирования отметили, что сгенерированные ИИ песни глубоко трогают текстом и тонкими эмоциями, знаменуя переход музыки от ИИ от простого комбинирования мелодий к профессиональному эстетическому самовыражению (Источник: 机器之心)
.jpg)
💡 Разное
OpenLaneLink:SRE 仅用 1600 美元 ESP32 成功替换六位数美金保龄球计分系统 : SRE-инженер поделился на Hacker News опытом перестройки системы подсчета очков в боулинге с использованием аппаратного обеспечения с открытым исходным кодом. Столкнувшись с коммерческим предложением поставщика в размере 120 000 долларов за закрытую систему, он использовал чип ESP32, протокол ESPNow и шлюз Raspberry Pi в сочетании с Redis и React для создания открытой системы подсчета очков под названием OpenLaneLink. Потратив всего 1600 долларов, он смог идеально контролировать 70-летние дорожки для боулинга, успешно разрушив монополию индустрии (Источник: Hacker News)
AI 文本检测器遭遇克星:当大模型开始模仿作者风格,检测器漏判率升至 29% : Команда Epoch AI провела оценку трех популярных детекторов ИИ-текста: Pangram, GPTZero и Originality.ai. Тесты показали, что когда модель ИИ просят сымитировать стиль письма конкретного автора, точность распознавания детекторов резко падает, пропуская в среднем 13% сгенерированного ИИ текста. В академическом письме этот показатель пропусков возрастает до 24%–29%, что указывает на наличие технических слепых зон у существующих инструментов обнаружения при предотвращении академической недобросовестности (Источник: THE DECODER)

Christopher Nolan 谈 AI 发展:它是大家都知道藏着希腊人的“透明特洛伊木马” : Режиссер Кристофер Нолан (Christopher Nolan), продвигающий свой новый фильм «Одиссея» (Odyssey), в интервью сравнил ИИ с «прозрачным троянским конем», отметив, что «все знают, что внутри прячутся греки». Он добавил, что никогда не видел, чтобы технология развивалась так быстро и при этом вызывала столь сильный скептицизм и отторжение у публики (особенно у молодежи), назвав эту настороженность по отношению к «ИИ-шлаку» (AI slop) и недоверие к мотивам технологических гигантов крайне здоровой реакцией (Источник: TechCrunch)