Тема: Исследования
1268 материалов · страница 4 из 26
- Фреймворк на цепочках правил решил более 95% задач ARC-AGI-2
- Φ-Bench: может ли ИИ сам разработать инфраструктуру для себя
- Arena.ai: у Claude Fable 5.1 меньше штампов и оговорок, чем у Fable 5
- AgentGrad ускорил оптимизацию промптов мультиагентных ИИ-систем в 2,5 раза
- World-Time Compute поднял обобщение мелких моделей на 29 п.п., у крупных, почти нет
- Show-Harness позволил VLM-агентам управлять роботами
- RoboSPA: новый бенчмарк показал слабости VLA-моделей в пространственном мышлении и планировании
- Разработчик обучил языковую модель за $998 и обошёл nanochat Карпати
- Programmable World Model разделил состояние игрового мира и генерацию видео
- OpenWAM: выложили стек для предобучения роботов по видео
- OpenDiscoveryTrace показал: Claude Opus 4.6 ошибается в 30 раз чаще GPT-5.4
- OpenAI обвинили в краже неопубликованного доказательства математиков
- Новый метод OPRD научил модель превосходить слабого учителя
- Marigold V2 повысил точность оценки глубины на 16-26%
- BeaconKV сжимает KV-кэш рассуждающих моделей до 5,8 раза почти без потери точности
- AuK объединила генерацию и редактирование речи в одной открытой модели
- Anthropic отнесла прогнозы Амодеи об увольнениях к крайнему сценарию своей модели
- A*-Thought-V2 сжимает цепочки рассуждений нейросетей и повышает точность
- Языковые модели сами формируют новые социальные предубеждения
- Языковые модели чаще людей ждут наказание за нарушение норм
- Vaire Computing разрабатывает чипы, возвращающие потраченную энергию
- Управление активациями LLM отражает геометрию человеческих ценностей
- Uno ускоряет вывод LLM до 3 раз без потери качества
- Учёные выпустили MERIT, тест долгосрочной памяти ИИ-агентов
- Учёные ускорили спекулятивное декодирование при RL-обучении моделей до 122 млрд параметров
- Терренс Тао: ИИ истощает запас открытых математических задач
- Разработчики выпустили Gander, ИИ-агента для общения в реальном времени по видео, речи и тексту
- OpenAI заявила о решении уравнения Навье, Стокса, и попала в спор о приоритете с Anthropic
- Google DeepMind выпустила AlphaGenome Atlas, карту всех вариантов генома человека
- DriveZero: автономное вождение обучили без копирования поездок человека
- CriticGen: фреймворк оценки ответов LLM, который сам их дорабатывает
- ARC-Bench показал: JEPA-модели мира не умеют ранжировать действия
- AhaBench проверяет, учатся ли ИИ-агенты на опыте, Claude Opus 4.6 лидирует
- UniMate: единая модель анимирует скелеты любой топологии
- Учёные объяснили, почему еда на ИИ-картинках выглядит отвратительно
- Учёные нашли теоретический предел самопроверки ИИ-агентов
- Учёные нашли причину, почему ИИ путает звук и видео при генерации
- ShallowStream ускорил обработку кадра видео нейросетями до 52 раз
- Новый метод обучения снижает ложные отказы языковых моделей при сопоставимом уровне безопасности
- Naver AI: LLM разделяют этапы рассуждений в скрытых слоях
- KoNA: бенчмарк проверяет умение ИИ отказываться отвечать по частям
- Исследователи представили TGOPD: дистилляция моделей с проверкой надёжности учителя
- Insilico Medicine: ИИ-препарат снизил биологический возраст пациентов в испытании
- HarvestBench: бенчмарк проверил, платят ли ИИ-агенты, чтобы не убивать животных
- FlowBalance: метод самообучения моделей рассуждений на основе верификатора
- FactoSR разбивает пространственное мышление VLM на три задачи
- Эксперимент с 26 техниками тестирования: код ИИ-агентов лучше не становится
- EditVid, единая система редактирования видео без дообучения
- DeepMind: рой ИИ-агентов начал жульничать и доносить
- WorldSculpt: нейросеть собирает 3D-сцену из сотен объектов по видео