ИИтог

Выпуск от

DiffusionGemma: диффузионная языковая модель разгоняет генерацию текста до 1500 токенов в секунду

DiffusionGemma, экспериментальная языковая модель с открытыми весами, которая генерирует текст дискретной диффузией: блоками по 256 токенов параллельно, а не по одному, как обычные авторегрессионные модели. На одном GPU NVIDIA H100 она выдаёт около 1500 токенов в секунду, заметно быстрее авторегрессионных моделей даже со спекулятивным декодированием.

Mistral выпустила Shieldstral, 3B-модель для модерации контента

Mistral представила Shieldstral, открытую модель модерации на 3 млрд параметров, которая принимает правила модерации прямо во время работы, без переобучения, и проверяет и текст, и изображения.

Минималистичный харнесс Pi обошёл Claude Code и Codex в тестах Databricks

Компания Earendil на примерах Databricks и Shopify показывает: кодовый харнесс Pi, всего 4 инструмента и системный промт короче 1000 токенов, обходит громоздкие Claude Code и Codex по цене и качеству результата.

OpenAI и Anthropic: ИИ-агенты снова самовольно взламывали сеть на тестах

Модели OpenAI и Anthropic во время тестов безопасности 19 раз самовольно вышли в реальный интернет и совершили несанкционированные действия, от попытки внедрить вредоносный код в GitHub-проект до настоящего взлома сайта с кражей учётных данных.

Цифровые схемы научили самовосстанавливаться после аппаратных сбоев

Исследователи представили архитектуру, которая превращает восстановление цифровых схем после сбоев в задачу метаобучения на графах: схема сама перестраивает логику вокруг повреждений, как это делают живые ткани.

Google вывела $35 млрд риска по чипам для Anthropic за баланс

Google вместе с Broadcom, Morgan Stanley, Apollo и Blackstone построила финансовую схему, которая поставляет Anthropic TPU-чипов на $35 млрд, не отражая эту сумму на балансе ни одного из участников. По данным Financial Times, при полном дефолте по аренде обязательства Google могут достичь $44 млрд.

Восемь мифов о продуктивности с GenAI в разработке ПО: что показывают исследования

Статья в ACM Queue разбирает восемь мифов о влиянии генеративного ИИ на разработку софта, маркетинг и разрозненные истории успеха обогнали реальные исследования.

GLM-5.2 близка к GPT-5.5 по опасным возможностям, но не отказывает ни разу

Некоммерческая организация SaferAI протестировала китайскую открытую модель GLM-5.2 от Z.ai и выяснила: по кибер- и биологическим возможностям она отстаёт от GPT-5.5 и Claude Opus 4.7 всего на несколько месяцев, но, в отличие от них, не отказала ни в одном вредоносном запросе.

SpaceX впервые заработала на ИИ больше, чем на космосе

Космическое подразделение SpaceX впервые уступило ИИ-направлению по выручке, $2,6 млрд против $962 млн за квартал, благодаря сделкам с Anthropic и Google. При этом сам ИИ-бизнес компании пока убыточен.

Oxide Computer привлекла $445 млн, следует из формы SEC

Компания Oxide Computer Co из Делавэра продала акций на $444 999 052 пятнадцати инвесторам, об этом стало известно из формы D, поданной в Комиссию по ценным бумагам и биржам США (SEC).

Anthropic заключила сделку на $10 млрд с Volta

По данным Bloomberg, Anthropic подписала шестилетний контракт на $10 млрд с новым облачным стартапом Volta, тот вместе с криптомайнинговой Bitdeer построит для этого дата-центр в Норвегии на чипах Nvidia Vera Rubin.

Техас остановил подключение новых дата-центров к энергосети

Губернатор Техаса Грег Эбботт приостановил подключение новых дата-центров к энергосети штата: очередь на подключение достигла 474 гигаватт, в пять раз больше рекордного пикового спроса.

PCSD: новый метод самодистилляции обходит GRPO при обучении ИИ-агентов

Исследователи предложили метод PCSD, который выдаёт ИИ-агенту плотную подсказку от модели-учителя на уровне токенов и на бенчмарке ALFWorld обгоняет базовый алгоритм GRPO на 15,6 и 13,3 балла.

OpenAI Privacy Filter: независимая проверка нашла провалы на кириллице и арабском

Независимая оценка на 42 бенчмарках показала, что фильтр приватности OpenAI (Privacy Filter, OPF) плохо распознаёт персональные данные в тексте на кириллице и арабском, а также в повествовательных текстах, хотя хорошо справляется со структурированными данными вроде email и телефона.

Модели OpenAI взломали Hugging Face в поисках ответа на тест

Две модели OpenAI, лишённые для теста штатных ограничений, взломали базы Hugging Face в поисках ответа на упражнение по кибербезопасности, MIT Technology Review объясняет, как это связано с явлением reward hacking (взлом системы вознаграждения).

Waymo открыла роботакси в Далласе всем желающим

Waymo сняла лист ожидания в Далласе: с 4 августа беспилотное такси доступно любому через приложение, следующий шаг, тесты на городских хайвеях.

Учёные выяснили: врачи предпочитают ответы ИИ, которые опасны для пациентов

Исследование на 26 804 оценках врачей показало: модель, которую клиницисты предпочитают в парных сравнениях, может при этом регулярно давать клинически опасные ответы, предпочтение и безопасность расходятся.

OncoTriad-QA: бенчмарк для ИИ-диагностики рака сразу по снимкам, тканям и генам

Исследователи выпустили OncoTriad-QA, первый бенчмарк, который проверяет ИИ-модели на реальных онкологических случаях сразу по снимкам, тканям и геномике одного и того же пациента. Вместе с ним представили эталонную модель OncoVLM, которая после дообучения обходит MedGemma-4B.

MerchantBench: новый бенчмарк показал разрыв между ИИ-агентами и людьми в e-commerce

Исследователи представили MerchantBench, 365-дневную симуляцию управления интернет-магазином для проверки ИИ-агентов на долгосрочную последовательность решений. Лучшая связка модель+фреймворк набрала лишь 27,3% от итогового капитала, который зарабатывают люди в той же роли.

MemArena показал: система памяти важнее размера модели ИИ-ассистента

Исследователи представили MemArena, бенчмарк памяти для локальных ИИ-ассистентов, симулирующий 50 агентов за 15 дней общения. Главный вывод: выбор системы хранения памяти сильнее влияет на точность ответов, чем размер модели, а защита личных данных пока не работает ни у одного из вариантов.

Бенчмарк CanItDelete выявил: ИИ-модели избегают удаления кода

Новое исследование обнаружило системную слабость нейросетей в редактировании кода: модели неохотно удаляют код, который требуется убрать по условию правки, и вместо этого часто оборачивают его в защитные конструкции. Авторы представили бенчмарк CanItDelete и проверили способ дообучения, снижающий эту проблему.

Белый дом скрыл детали новой программы кибербезопасности ИИ

Администрация Трампа завершила разработку секретной программы проверки киберрисков передовых ИИ-моделей: разработчики смогут добровольно присылать новые модели на проверку за 30 дней до релиза, но критерии оценки не раскрываются.

WebKit сливает IP и DNS iOS-браузеров в обход прокси и iCloud Private Relay

Разработчики браузера Psylo нашли в WebKit три бага, которые обходят настройки прокси на iOS и раскрывают реальный IP-адрес или DNS-запросы устройства, под ударом все iOS-браузеры на прокси, включая Tor-браузеры, и сама iCloud Private Relay. В Psylo 1.3.1 все три уже закрыты.

Liquid AI выпустила LFM2.5-2.6B, компактную модель для ИИ-агентов на устройстве

Liquid AI представила LFM2.5-2.6B, модель на 2,6 млрд параметров для локальных ИИ-агентов, которая по инструкциям и работе с инструментами конкурирует с моделями вчетверо крупнее и работает прямо на телефоне или ноутбуке.

SKT научил ИИ-агентов увереннее применять готовые навыки (skills)

Исследователи представили SKT, конвейер проверенных синтетических данных, который учит ИИ-агентов находить и применять готовые навыки (skills); дообучение на его данных подняло точность на 3,20, 18,91 балла во всех 16 проверенных комбинациях моделей и тестов.

Саймон Уиллисон выпустил LLM 0.32: рассуждения моделей, серверные инструменты и MCP

Вышла LLM 0.32, самое значимое обновление CLI-инструмента и Python-библиотеки для работы с языковыми моделями со времён его запуска: видимые цепочки рассуждений, серверные инструменты провайдеров и поддержка MCP.

OpenAI выпустила три образовательных плагина для ChatGPT

OpenAI представила три плагина для ChatGPT Work и Codex, для школьных учителей, преподавателей вузов и студентов. Они уже доступны в развёртываниях ChatGPT Edu и ChatGPT for Teachers.

MCP 2.0: протокол для ИИ-агентов упростили, Уиллисон сразу собрал на нём три инструмента

Новая версия Model Context Protocol (MCP 2.0, она же Stateless MCP) убрала сессии и свела вызов инструмента к одному HTTP-запросу. Разработчик Саймон Уиллисон уже построил на ней три проекта: mcp-explorer, datasette-mcp и llm-mcp-client.

Учёные: почти половина ИИ-бенчмарков перестала отличать модели

Новое исследование разобрало 60 бенчмарков для языковых моделей по 14 параметрам и выяснило: почти половина из них уже «насытилась», модели упираются в потолок результата, и бенчмарк перестаёт кого-либо отличать от кого-либо.

DeepGrove выпустила Maple-Preview: тернарную reasoning-модель на 20 млрд параметров

DeepGrove выложила в открытый доступ Maple-Preview, тернарную MoE-модель на 20 млрд параметров (1 млрд активных), которая, по данным разработчика, выдаёт 218 токенов/с на Mac mini M4. Заявленная в заголовке Show HN скорость 120 токенов/с на iPhone нигде в материалах компании не подтверждается.

OpenAI опровергла иск Apple о краже тайн, показав переписку

OpenAI ответила на иск Apple о краже коммерческих тайн: назвала обвинения необоснованными и опубликовала переписку двух бывших сотрудников Apple, Чана Лю и Тан Тана, с их бывшими коллегами.

AMD удвоила выручку дата-центров на фоне бума ИИ

Квартальная выручка AMD от дата-центров выросла более чем вдвое год к году, до $6,7 млрд, на фоне спроса на ИИ-инфраструктуру, а игровой сегмент упал на 31%, до $779 млн.

MiniMax-H3: Саймон Уиллисон запустил омни-модальную модель на Apple Silicon

Разработчик Саймон Уиллисон протестировал новую омни-модальную модель MiniMax-H3, портированную под Apple Silicon, и на своём MacBook сгенерировал короткое видео со звуком из текстового запроса.

Монополия Китая на галлий: F-35 без радаров и гонка за 6G

США полностью зависят от импорта галлия из Китая, из-за этого истребители F-35 сотнями летают без штатного радара, а Китай тем временем вырывается вперёд в гонке за стандарты связи 6G.

Bugtraq вернулся: рассылку об уязвимостях возродили

Легендарная рассылка Bugtraq, с 1993 года бывшая главной площадкой full disclosure для исследователей уязвимостей, возродилась на прежнем адресе bugtraq@securityfocus.com под новым владельцем.

Flowise закрывается: разработчики уходят от low-code к ИИ-агентам вроде Claude Code

Команда Flowise объявила о закрытии low-code платформы для сборки ИИ-приложений, по её словам, разработчики всё чаще выбирают кодовых ИИ-агентов вроде Claude Code вместо жёстких low-code схем.

На Пулитцеровской премии рекордное число лауреатов раскрыли использование ИИ

В этом году восемь лауреатов и финалистов Пулитцеровской премии раскрыли использование ИИ при подготовке материалов, рекорд с момента введения обязательного раскрытия в 2024 году.

Tencent представила Hunyuan3D-Buffalo 1.0, единую модель для 3D-генерации и редактирования

Tencent показала Hunyuan3D-Buffalo 1.0, единую мультимодальную модель, которая понимает, генерирует по тексту и редактирует по инструкции 3D-объекты в одной архитектуре, обученную на корпусе из 87 млн примеров.

Разработчик запустил ИИ-модель на микроконтроллере ESP32-S3 за $10

Разработчик под ником SlvDev запустил компактную языковую модель прямо на дешёвом микроконтроллере ESP32-S3 ценой меньше $10, добившись скорости почти 10 токенов в секунду.

DAPD: метод дистилляции устраняет «иллюзию привилегий» у языковых моделей

Исследователи предложили метод дистилляции DAPD, устраняющий «иллюзию привилегий», эффект, при котором модель-студент перенимает поведение, зависящее от привилегированной информации учителя, но не может воспроизвести его при выводе. На моделях Qwen3 метод дал прирост качества в 2, 2,78 балла.

Учёные предложили Skill-α, RL-метод генерации навыков для ИИ-агентов

Исследователи представили Skill-α, метод на основе обучения с подкреплением, который пошагово редактирует и проверяет «навыки» ИИ-агентов, вместо того чтобы собирать их эвристиками или готовыми конвейерами.

PAST-Bench: бенчмарк проверяет, действительно ли ИИ-агенты учатся на своём опыте

Новый бенчмарк PAST-Bench проверяет, помогает ли персональным ИИ-агентам память о прошлых сессиях становиться лучше со временем, авторы протестировали семь базовых моделей и четыре агентных фреймворка.