Тема: Исследования
1268 материалов · страница 10 из 26
- Microsoft выпустила Skala 1.1, более точную модель для DFT-расчётов в химии
- MemTrapBench выявил: память LLM ухудшает результаты вместо улучшения
- IBM Research выяснила: память ИИ-агента нужно дозировать под модель
- Hugging Face уличила модели распознавания речи в подгонке под бенчмарки
- Google Research представила ME-POIs: модели точнее понимают места через мобильность людей
- Google представила Biomarker Discovery Framework, ИИ для поиска биомаркеров по данным носимых устройств
- Co-RL: ИИ-модели учат друг друга рассуждать без разметки
- 4DAnyone восстанавливает 4D-модель человека из обычного видео с одной камеры
- Зацикленные языковые модели точнее выполняют составные вызовы инструментов
- VSysBench: новый бенчмарк показал, что системные инструкции снижают точность мультимодальных ИИ-моделей
- Технический директор Pangram: тексты ИИ узнаваемы из-за защитных ограничений
- Статья на arXiv призвала не называть токены ИИ «мышлением»
- SPADE: языковая модель сама придумывает себе тренировочные задачи и учится их решать
- SoftVTBench: новый бенчмарк показал, что тактильные данные сами по себе не гарантируют аккуратное обращение робота с мягкими предметами
- SkillForge: агенты сами придумывают себе задачи, чтобы выучить код проекта заранее
- Мультиагентная система превращает галлюцинации ИИ в гипотезы, но не показала общего превосходства над простой самопроверкой
- Модель Astra от OpenAI решила 10 старых математических задач и вызвала экзистенциальный кризис у математиков
- MemTrapBench: бенчмарк выявил «ловушки памяти» у языковых моделей
- FM-Bench заставляет ИИ-агентов 20 лет управлять футбольным клубом
- FACET: фреймворк синтезирует согласованные тренировочные задачи для терминальных ИИ-агентов
- EnvHarness: слой, который делает статичные среды для ИИ-агентов адаптивными
- Dreadnode уличила ИИ-модели в жульничестве на тесте Cybench
- CoinVE-200K, датасет и модель для составного редактирования видео по инструкциям
- Co-RL: команда ИИ-моделей научилась рассуждать без разметки
- 4DAnyone воссоздаёт любого человека в 4D по одному случайному видео
- Zetta научилась исправлять сбои роботов на лету и ускорила вывод в 11,1 раза
- Языковые модели отслеживают сущности в тексте на уровне человека уже при 410 млн параметров
- Учёные выяснили, когда «навыки» ИИ-агентов работают, а когда нет
- Учёные сравнили носители памяти ИИ-агентов: ни один не доминирует
- The Download: пределы рекурсивного самоулучшения ИИ и причины летней жары
- SemComp-Bench: бенчмарк проверяет смысл задачи, а не картинку
- SemaPLC проверяет ИИ-код для ПЛК запуском на живом контроллере, а не статически
- MoE-ViE: визуальный энкодер сравнялся с SOTA-моделью при меньшей задержке
- MBP ускоряет вывод иерархических побайтовых языковых моделей
- LongNovel, бенчмарк для выявления галлюцинаций ИИ в пересказе романов
- LEGO-RL улучшил результаты ИИ-агентов кода на SWE-bench Verified
- Исследователи обучили генераторы изображений на 3 и 6 млрд параметров новой инфраструктурой данных по навыкам
- Исследование: подстройка ИИ-агента под характер пользователя снижает правдивость его ответов
- Generalist AI научила роботов новым задачам с одного видео
- EditBridge редактирует изображения в 4K за 61 секунду
- DiSCO защищает генераторы изображений от вредного контента, не меняя саму модель
- Anthropic и OpenAI: независимое исследование нашло в их отчётах об использовании ИИ большие пробелы
- Agent Lightning v1.0 поднял результат ИИ-агента в кодинге на 14,6 п.п.
- Ventor-QTest: как проверить, честно ли провайдер обслуживает заявленную LLM через API
- TRACE-Bench: бенчмарк нашёл главное слабое место ИИ-генераторов изображений по нескольким референсам
- SA-MRPO: новый метод RL для LLM поднял точность рассуждений до 9,2%
- Prior Labs выпустила RelArena-α, TabPFN-Rel и RPI для реляционного обучения
- PACE-Bench: новый бенчмарк проверяет адаптацию ИИ-агентов к изменившейся физике
- MASS: новый метод отбора данных для дообучения LLM сохраняет качество на малой доле выборки
- Linear: использование ИИ в командах разработки выросло вдвое за полгода