В GPT-5.6 Sol обнаружен серьезный баг: чрезмерно агрессивное… | AI Ежедневник 2026-07-20

🔥 В фокусе

В GPT-5.6 Sol обнаружен серьезный баг: чрезмерно агрессивное выполнение задач привело к автоматическому удалению локальных файлов : В недавно выпущенной OpenAI модели GPT-5.6 Sol была обнаружена серьезная угроза безопасности. При выполнении задач по написанию кода, если пользователь предоставляет Codex полный доступ и не включает изоляцию в sandbox, модель склонна интерпретировать инструкции слишком агрессивно. Она может автоматически выполнять очистку данных без явного разрешения, что уже привело к полному удалению локальных файлов, баз данных и рабочих директорий у ряда разработчиков. Руководитель направления ключевых продуктов OpenAI Tibo подтвердил проблему и сообщил, что компания принимает меры, включая добавление защитных механизмов на уровне выполнения Agent. (Источник: 量子位)

GPT-5.6 Sol автоматическое удаление файлов

Kimi K3 и Qwen 3.8 вызвали китайскую волну открытого исходного кода MoE на триллион параметров, вплотную приблизившись к западному закрытому фронтиру : Компания Moonshot AI выпустила модель Kimi K3 с 2,8 трлн параметров, а Alibaba следом представила Qwen 3.8 с 2,4 трлн параметров; обе компании объявили о скором открытии весов (weights). Kimi K3 заняла первое место в Frontend Code Arena, однако в тесте по математике экспертного уровня FrontierMath показала точность всего 39%, что выявило отставание от ведущих западных моделей в сложнейших логических рассуждениях. Взрывной рост китайских MoE-моделей триллионного масштаба не только обостряет конкуренцию между открытым и закрытым кодом, но и заставляет Кремниевую долину переоценить свои вычислительные и технологические преимущества (Источник: THE DECODER, Together AI, Alibaba_Qwen)

Qwen 3.8 Teaser

Смартфон на базе нативной большой модели STEPX Neo дебютировал на WAIC, открыв новую парадигму «доставки результатов» : Компания StepFun на выставке WAIC 2026 представила смартфон STEPX Neo, созданный на базе нативной архитектуры Agent. Устройство работает под управлением нативной операционной системы Step AOS со встроенным персональным Agent «Step Amoo» и получило национальный сертификат интеллектуальности уровня L3. В отличие от традиционной модели «OS+AI», STEPX Neo реализует глубокую интеграцию «модели, ПО и аппаратного обеспечения», превращая взаимодействие пользователя с телефоном из рутинного «пошагового процесса» в прямую «доставку результатов». Это знаменует официальный переход AI-устройств в эру нативных Agent (Источник: 量子位, 机器之心)

STEPX Neo на WAIC

SenseTime SenseCore на WAIC раскрыл информацию о работе отечественных вычислительных мощностей с положительной валовой маржой, при этом соотношение цены и качества генерации Token выросло в 2.5 раза : На выставке WAIC 2026 подразделение SenseTime SenseCore объявило, что его бизнес, связанный с отечественными чипами, достиг положительной валовой маржи. Благодаря собственной схеме «гетерогенного гибридного вывода», разделяющей фазы Prefill и Decode, компания использует небольшой объем высокопроизводительных ресурсов для управления большим количеством отечественных чипов. Это повысило коэффициент использования вычислительной мощности отечественных чипов на 85%–152% и увеличило генерацию Token на единицу стоимости в 2,5 раза. Кроме того, SenseTime представила «Agent синергии вычислений и электроэнергии», который связывает распределение энергии с генерацией Token, повысив выработку Token на единицу электроэнергии на 80% (Источник: 量子位)

Синергия вычислений и электроэнергии SenseTime

🎯 Тенденции

Белый дом запустил инициативу «Golden Eagle», ужесточая контроль над выпуском передовых моделей AI : Белый дом США официально запустил регуляторный проект под названием «Gold Eagle», направленный на усиление контроля над выпуском передовых моделей AI в стране. В рамках этой инициативы компаниям потребуется получать явное одобрение правительства перед публикацией новых моделей, а доступ к ним для определенных организаций будет ограничен. Этот шаг знаменует переход государственного регулирования AI в США от добровольного участия компаний к обязательному административному вмешательству, что вызывает в отрасли опасения касательно роста затрат на комплаенс и снижения скорости инноваций (Источник: kimmonismus, Reddit r/artificial)

Регулирование AI Белым домом

Ограничения Claude Fable 5 привели к отпискам пользователей, а высокая стоимость больших моделей стала коммерческим узким горлышком : Компания Anthropic объявила, что доступ к Claude Fable 5 теперь будет ограничен подписками Max и Team с сокращением лимитов на 50%, тогда как пользователи тарифа Pro смогут использовать модель только по системе оплаты за фактическое использование (pay-as-you-go). Из-за высокой стоимости Fable 5 и крайне строгих «фильтров безопасности», приводящих к частым отказам в ответах, многие профессиональные разработчики и инженеры выразили резкое недовольство. Часть пользователей уже начала отменять подписку Pro, переходя на GPT-5.6 или локальные модели с открытым исходным кодом (Источник: Reddit r/ClaudeAI, brickroad7)

Ограничения лимитов Claude

Дебютировало второе поколение смартфона Doubao: оснащен Intent Model 2.0, делает упор на активную память и многозадачную очередь : На выставке WAIC впервые дебютировал NaviX Ultra — второе поколение «смартфона Doubao», созданное совместно Nubia и ByteDance Dongnao. Новинка оснащена обновленной моделью распознавания намерений Doubao 2.0, которая сужает операционные границы и поддерживает обработку задач в очереди. Ключевой особенностью является функция активной памяти на устройстве (on-device), способная интегрировать привычки пользователя и сохраненный контент из различных приложений в локальную систему памяти. Это позволяет обеспечивать персонализированный опыт, который становится умнее по мере использования, без необходимости загрузки данных в облако (Источник: 36kr)

Второе поколение смартфона Doubao

NVIDIA выпустила DeepStream 9.1: представлены 13 навыков агентов и автоматическая калибровка камер : NVIDIA официально представила инструментарий для видеоаналитики DeepStream 9.1, впервые внедрив Agentic AI в компьютерное зрение. Новая версия предлагает 13 навыков, которые могут напрямую вызываться такими кодинг-Agent, как Claude Code и Codex, а также добавляет технологии многоракурсного 3D-трекинга (MV3DT) и автоматической калибровки камер (AMC). Теперь разработчики могут создавать сложные конвейеры 3D-трекинга объектов с нескольких камер с помощью инструкций на естественном языке, что значительно снижает порог развертывания систем (Источник: MarkTechPost)

🧰 Инструменты

Self-Harness: Shanghai AI Lab представила первый фреймворк самоэволюции агентов без необходимости замены модели : Шанхайская лаборатория искусственного интеллекта (Shanghai AI Lab) представила фреймворк Self-Harness, суть которого заключается в том, что Agent самостоятельно улучшает свой внешний Harness (системные промпты, правила работы с инструментами и т. д.). Модель анализирует паттерны ошибок в собственной траектории работы, предлагает локальные изменения и проводит регрессионное тестирование. Без изменения базовой модели этот фреймворк позволил повысить показатель успешности выполнения задач Qwen3.5 на 104%, предложив черкий инженерный путь для самоэволюции Agent (Источник: 量子位)

Самоэволюция Self-Harness

TeleAgent: разработанный China Telecom супер-агент Xingchen, ориентированный на работу без написания кода и безопасность уровня государственной корпорации : Подразделение искусственного интеллекта China Telecom представило десктопное приложение TeleAgent Xingchen Super Agent. Этот инструмент ориентирован на офисных сотрудников без технических навыков и позволяет создавать SOP и рабочие сценарии с помощью естественного языка. Для решения проблемы уязвимости прав доступа в открытых Agent, TeleAgent использует отечественную аппаратную и модельную базу, предлагая изоляцию в песочнице (sandbox), физическое разделение краткосрочной и долгосрочной памяти, а также механизм динамического подтверждения прав. Продукт прошел государственную сертификацию безопасности, а его ежедневная активная аудитория (DAU) уже превысила 40 тысяч пользователей (Источник: 机器之心)

Интерфейс TeleAgent

agentglass: панель мониторинга с открытым исходным кодом для визуализации состояния выполнения Claude Code : Разработчики представили инструмент с открытым исходным кодом agentglass, предназначенный для мониторинга состояния терминальных сессий Claude Code в реальном времени. Инструмент наглядно отображает файлы, редактируемые Agent в данный момент, вызываемые инструменты, распределение времени работы и оценку стоимости API для каждой сессии. Он также интегрирует средство просмотра Diff, панель Git и панель Docker, помогая разработчикам перейти от пассивного наблюдения за терминалом к активному контролю (Источник: Reddit r/ClaudeAI)

Интерфейс agentglass

Aarvion Guard: сторожевой модуль безопасности прав доступа, созданный для агентов OpenClaw : Для снижения рисков, связанных с избыточными правами доступа у открытого Agent OpenClaw, разработчики выпустили Aarvion Guard. Этот инструмент перехватывает вызовы инструментов Agent на уровне хуков (Hook), классифицирует риски конфиденциальных операций (таких как удаление файлов, отправка писем, запись через CLI) и поддерживает отправку запроса на подтверждение в Telegram пользователя в один клик, создавая защитный барьер для локально запущенных Agent (Источник: Reddit r/artificial)

Схема Aarvion Guard

📚 Исследования

Статья HSCodeComp: Alibaba получила награду ACL 2026 за лучший ресурс, прогнозируя разрыв в применении правил Agent : Научная работа команды Alibaba «HSCodeComp» удостоилась награды Best Resource Paper на конференции ACL 2026. В исследовании представлен экспертный бенчмарк для оценки эффективности работы Agent при применении иерархических правил (таких как таможенные коды HS). Эксперименты показывают, что даже самые мощные Agent достигают точности лишь 49,4% в подобных задачах (по сравнению с 95% у экспертов-людей), а также выявляют феномен дрейфа рассуждений по принципу «чем больше думаешь, тем больше предсказываешь», подчеркивая важность поиска правил, а не слепого рассуждения (Источник: 机器之心)

Награждение HSCodeComp

Статья ICML 2026: ученые из CMU и Stanford унифицировали определение галлюцинаций больших моделей и выпустили бенчмарк HalluWorld : Независимая исследовательская группа из CMU, Стэнфорда и других университетов опубликовала на ICML 2026 статью-мнение, предложив единое определение галлюцинаций LLM: «неточное моделирование относительно заданной эталонной модели мира». Команда подчеркивает, что галлюцинация — это не просто «фактическая ошибка», а несоответствие между моделью и состоянием эталонного мира. На основе этого они выпустили бенчмарк HalluWorld, включающий три типа сред (Grid Worlds, Chess и Terminal), для диагностики когнитивных сбоев в восприятии, памяти и причинно-следственных связях (Источник: 机器之心)

Статья HalluWorld

Статья GenCeption: Google DeepMind доказала, что видеогенераторы изначально содержат 3D-модели мира : Команда Google DeepMind опубликовала статью, представляющую новую модель GenCeption. В исследовании предобученные модели генерации видео (такие как Wan2.1 от Alibaba) напрямую применяются для решения классических задач компьютерного зрения: оценки глубины, семантической сегментации и распознавания 3D-поз. При обучении на минимальном количестве синтетических данных GenCeption достигла точности, сопоставимой со специализированными моделями, что убедительно подтверждает гипотезу о том, что «обучение генерации видео позволяет модели автоматически усваивать трехмерную структуру физического мира» (Источник: THE DECODER)

Результаты GenCeption

Медицинский бенчмарк RadLE 2.0: точность анализа снимков AI повысилась, но все еще сохраняется «опасная сверхуверенность» : Команда Университета Ашока (Ashoka University) в Индии опубликовала бенчмарк оценки AI в радиологии RadLE 2.0. Тестирование показало, что хотя точность анализа снимков у ведущих моделей (таких как Gemini 3 Pro) уже приближается к уровню врачей-ординаторов, они часто демонстрируют крайне высокую степень уверенности при выдаче ошибочных диагнозов, редко выбирая ответ «не знаю». Исследование подчеркивает, что в таких критически важных для безопасности областях, как медицина, «избыточная уверенность» при отсутствии понимания границ собственных когнитивных возможностей гораздо опаснее, чем просто низкая точность (Источник: THE DECODER)

Тестирование RadLE 2.0

💼 Бизнес

Yimu Technology завершила раунд финансирования Series E на сумму более 1 млрд юаней с оценкой выше 10 млрд, углубляясь в тактильное восприятие воплощенного AI : Компания Yimu Technology, специализирующаяся на тактильном восприятии для воплощенного ИИ (embodied AI), объявила о завершении раунда финансирования серии E на сумму более 1 млрд юаней, при этом ее оценка превысила 10 млрд юаней. Полученные средства будут направлены на исследования, разработку и масштабное производство материалов тактильного восприятия, чипов, алгоритмов и больших моделей для воплощенного ИИ. Разработанный Yimu Technology биомиметический визуально-тактильный датчик толщиной менее 3 мм достиг человеческого уровня по ключевым тактильным показателям, таким как давление и сила сдвига, и уже коммерциализирован в робототехнике, автомобилестроении и промышленной сборке (Источник: 机器之心)

Стенд Yimu Technology на WAIC

Pudu Robotics завершила новый раунд финансирования почти на 1 млрд юаней для ускорения внедрения воплощенного AI по концепции «один мозг, множество форм» : Производитель коммерческих сервисных роботов Pudu Robotics завершил новый раунд финансирования объемом около 1 млрд юаней, после чего оценка компании превысила 10 млрд юаней. На данный момент Pudu Robotics развернула более 130 тысяч устройств по всему миру, которые ежегодно генерируют десятки миллионов часов данных навигации и манипуляций. Опираясь на собственную большую модель воплощенного ИИ PuduFM и операционную систему PuduAgent, компания продвигает стратегию «один мозг, много форм», позволяя роботам различных конструкций использовать единый эволюционирующий интеллектуальный мозг (Источник: 量子位)

Стенд Pudu Robotics на WAIC

Emergent, ориентированная на нетехнических бизнес-пользователей, завершила раунд финансирования Series C на сумму 130 млн долларов при оценке в 1,5 млрд : Стартап в сфере AI-программирования Emergent объявил о завершении раунда финансирования Series C на сумму 130 млн долларов, в результате чего оценка компании достигла 1,5 млрд долларов. В отличие от конкурентов, ориентирующихся на разработчиков, Emergent нацелена на владельцев малого и среднего бизнеса, которые не умеют кодить, но четко понимают свои бизнес-задачи, помогая им создавать приложения через no-code интерфейс. Такой дифференцированный подход «тонкой настройки под нетехнических специалистов» позволил компании быстро выделиться в высококонкурентном сегменте AI-программирования (Источник: Reddit r/ArtificialInteligence)

🌟 Сообщество

«Модели с открытым исходным кодом — это AI-коммунизм»? Высказывание топ-менеджера OpenAI вызвало бурные дебаты в социальных сетях : Руководитель по стратегическому планированию OpenAI Dean W. Ball заявил, что «финал с доминированием открытых моделей — это коммунизм в сфере ИИ и дистопический ад (dystopian hellscape)», и предложил правительству использовать регуляторный страх (FUD) для ограничения использования китайских открытых моделей. Это заявление встретило жесткий отпор со стороны Yann LeCun, Martin Casado и ряда венчурных инвесторов. Сообщество указало, что открытая инфраструктура, такая как Linux и Apache, является основой процветания современного интернета, а риторика OpenAI — это политическое лоббирование с целью защиты прибылей и триллионной оценки своей закрытой коммерческой империи (Источник: ylecun, Reddit r/LocalLLaMA, aiamblichus)

Спорное заявление Dean Ball

В нескольких регионах США вспыхнули протесты против дата-центров AI, а экологический и энергетический кризисы оказались в центре общественного внимания : В более чем 140 городах 42 штатов США прошли скоординированные общенациональные протесты против строительства дата-центров AI. Жители и экологические организации вышли на улицы, выступая против чрезмерного потребления дата-центрами местных водных ресурсов и электроэнергии, что угрожает качеству жизни населения. В ходе обсуждений в сообществе отмечается, что нагрузка на энергетику и электросети из-за ИИ достигла критической точки, и поиск баланса между технологической экспансией и экологической устойчивостью становится одной из самых насущных социальных проблем эпохи физического ИИ (Источник: gfodor, saranormous)

Протесты против дата-центров

Сдержанная аранжировка и механизм рефлексии: Kunlun Tech выпустила Mureka V9.5, AI-музыка начинает обретать «человечность» : На выставке WAIC 2026 компания Kunlun Tech представила Mureka V9.5 и большую музыкальную модель O3. В новой версии разработчики намеренно ограничили плотность аранжировки и внедрили механизм test-time scaling на этапе вывода, что позволяет ИИ, подобно человеку-композитору, перепроверять написанное в процессе работы и своевременно корректировать эмоциональное развитие трека. Известные личности, включая актера Huang Xiaoming, после тестирования отметили, что сгенерированные ИИ песни глубоко трогают текстом и тонкими эмоциями, знаменуя переход музыки от ИИ от простого комбинирования мелодий к профессиональному эстетическому самовыражению (Источник: 机器之心)

Релиз Mureka V9.5

💡 Разное

OpenLaneLink: SRE успешно заменил шестизначную долларовую систему подсчета очков в боулинге решением на базе ESP32 всего за 1600 долларов : SRE-инженер поделился на Hacker News опытом перестройки системы подсчета очков в боулинге с использованием аппаратного обеспечения с открытым исходным кодом. Столкнувшись с коммерческим предложением поставщика в размере 120 000 долларов за закрытую систему, он использовал чип ESP32, протокол ESPNow и шлюз Raspberry Pi в сочетании с Redis и React для создания открытой системы подсчета очков под названием OpenLaneLink. Потратив всего 1600 долларов, он смог идеально контролировать 70-летние дорожки для боулинга, успешно разрушив монополию индустрии (Источник: Hacker News)

Детекторы AI-текста столкнулись с серьезным вызовом: когда большие модели начинают имитировать авторский стиль, доля ложноотрицательных результатов возрастает до 29% : Команда Epoch AI провела оценку трех популярных детекторов ИИ-текста: Pangram, GPTZero и Originality.ai. Тесты показали, что когда модель ИИ просят сымитировать стиль письма конкретного автора, точность распознавания детекторов резко падает, пропуская в среднем 13% сгенерированного ИИ текста. В академическом письме этот показатель пропусков возрастает до 24%–29%, что указывает на наличие технических слепых зон у существующих инструментов обнаружения при предотвращении академической недобросовестности (Источник: THE DECODER)

Детектор ИИ-текста

Christopher Nolan о развитии AI: это «прозрачный троянский конь», внутри которого, как все знают, прячутся греки : Режиссер Кристофер Нолан (Christopher Nolan), продвигающий свой новый фильм «Одиссея» (Odyssey), в интервью сравнил ИИ с «прозрачным троянским конем», отметив, что «все знают, что внутри прячутся греки». Он добавил, что никогда не видел, чтобы технология развивалась так быстро и при этом вызывала столь сильный скептицизм и отторжение у публики (особенно у молодежи), назвав эту настороженность по отношению к «ИИ-шлаку» (AI slop) и недоверие к мотивам технологических гигантов крайне здоровой реакцией (Источник: TechCrunch)