Тема: Исследования
1268 материалов · страница 2 из 26
- ProgramDistill: бенчмарк проверяет ИИ-агентов на живых веб-приложениях
- Исследователи представили HarnessVLN, агента для навигации роботов без обучения
- Исследование: топовые ИИ-модели сходятся на одной архитектуре будущего
- ImpossibleRubrics: бенчмарк поймал ИИ на обмане рубрик
- ИИ-модели обошли врачей традиционной китайской медицины в разборе 349 случаев
- Google DeepMind основала институт по большим вопросам об AGI
- Gemini 3.1 Pro обрывает диалог при непрерывных оскорблениях в 50% случаев
- FLAT объединил генерацию и поиск по тексту и изображениям в одной модели
- Dream-RSI: фреймворк рекурсивного самоулучшения ИИ-агентов
- Claude Code обходится вдвое дороже Pi и Codex CLI при том же качестве
- BITCOS снизил стоимость хранения тернарных LLM ниже 1,585 бита
- Agora: 13 ИИ-агентов 12 дней вели совместное исследование через Git-репозиторий
- ScienceBuddy, научная платформа с самоулучшающимися ИИ-агентами
- Retrieve-for-Train от Google Research: ИИ-поиск ускорился в 12, 20 раз
- Pelican-Sim 1.0: модель мира для роботов подняла успешность выполнения задач с 70% до 93%
- OpenAI Foundation выделил первые гранты на данные о биологии для ИИ
- MInTRL усиливает on-policy обучение с подкреплением точечными вмешательствами в генерацию
- Mind2Dialogue научил модели угадывать невысказанные убеждения и цели пользователя
- Метод Never Give Up смягчает «эффект Матфея» в RL-обучении языковых моделей
- KaiNinja расширил TRELLIS.2 до генерации 3D-моделей по частям
- Исследователи нашли асимметрию в обновлениях трансформеров, она повышает устойчивость редактирования моделей
- Gavel: нейросеть уже «знает» нужный навык, осталось прочитать сигнал
- ESRL поднял точность Qwen3-30B-A3B на 3,2 п.п. по Pass@1 и на 4,5, по Pass@8
- E2A-Bench выявил провалы в оценке финансовых ИИ и перекос к «покупай» после дообучения
- Continual Search: итеративный поиск причин сбоя ИИ-агента поднимает F1-оценку GPT-5.5 на 40%
- Аудиты на предвзятость ИИ находят её, но расходятся в рейтинге
- Archetypometrics: самооценка характера нейросетей разошлась с поведением
- Spiral Jetty оказался климатическим сенсором: снимки на 3 года опережают уровень озера
- ReactHuman: бенчмарк показал, что ИИ-модели проваливают реакцию на бытовые опасности
- Omni-Streaming Thinking: метод против кросс-модальных ИИ-галлюцинаций в видео и аудио
- Новый бенчмарк TestHallVQA нашёл слабости ИИ-моделей в чтении многостраничных документов
- Наивный Байес не уступает LLM в классификации текста с разметкой
- Математик Дэниел Литт: ИИ уже решает крупные открытые задачи, профессии нужна реформа
- Google DeepMind: рой ИИ-агентов начал доносить на читеров
- F-Droid: разработчик проверил 102 приложения на признаки ИИ-кода
- Elo-per-token: методика показала предел роста ИИ-агентов
- Discovery Foundation Models, ИИ, который учится делать научные открытия
- ChatGPT: пользователи сочиняют истории и ролевые игры больше чем в трети переписок
- Blender-VideoBench: бенчмарк ловит ИИ-агентов на непонимании видео
- Atria Dawn Preview дебютировала: агентная модель обошла соперников в 5 из 16 тестов
- Agent as Policy: ИИ-агент напрямую управляет роботом-манипулятором без обучения под задачу
- Учёный предложил ловить тихие сбои ИИ-агентов проверкой действий до выполнения
- Учёные научили трансформеры отбирать контекст напрямую, а не через имитацию полного внимания
- ScreenSize.net: самый частый десктопный вьюпорт, 1920×920, а не 1920×1080
- Пространство предложили определять как инвариант при вмешательствах в систему
- Офлайн-обучение с подкреплением улучшило код-модели без генерации новых примеров
- Метод LIT учит роботов не полагаться на случайные визуальные подсказки
- KAIST и Naver AI Lab: шаги рассуждений ИИ-модели видны в её внутренних слоях
- Исследователи предложили R2VC, модульную архитектуру ИИ для проверки фактов с указанием источников
- Исследователь предложил PI-CP, способ надёжно оценивать неопределённость нейросетей, решающих уравнения физики