Тема: Исследования
1268 материалов · страница 8 из 26
- Lemmalog превращает память ИИ-агента в движок анализа кода на Datalog
- JAMA: автономный ИИ превзойдёт врачей уже к 2030 году
- Исследователи представили MA-VLA, модель для совместной работы нескольких роборук
- Исследователи предложили RLHEV: игровые движки как источник наград для моделей мира
- Hugging Face добавил хинди в Open ASR Leaderboard: тест на перекос в распознавании речи
- Google DeepMind: Co-Scientist сам ставит эксперименты и пишет научные статьи
- Gated Recurrent Transformer: 3 слоя дают точность 12-слойного GPT-2 Small
- GameWAM: первая модель мира и действий для видеоигр
- Эволюционные стратегии обошли GRPO по охвату рассуждений LLM
- AnTrap выявил уязвимость ИИ-агентов для Android к сбоям
- VoiceMem: потоковая память для голосовых ИИ обходит Mem0 почти на 30 баллов
- Video-IFBench: новый бенчмарк показал, что ИИ-модели плохо следуют сложным инструкциям при работе с видео
- UrbanGround: новый бенчмарк показал, что ИИ-агенты сбиваются с пути в виртуальном Гонконге
- Уортонская школа показала: ИИ-агенты пока не готовы делать покупки за вас
- StreamPI научил роботов помнить прошлое и обошёл модель pi0.5
- PAWBench: новый бенчмарк показал, что видеогенераторы не воспроизводят верное распределение исходов
- Mixed SFT обошёл RL-метод рассуждений, дешевле более чем в 60 раз
- Google представила planetary prediction engine (PPE): ИИ сам строит геопрогнозы за минуты вместо недель
- Code World Model: код агента, а не видео, управляет симуляцией мира
- Claude Opus 5 решил 30% задач в новом научном бенчмарке ИИ-агентов Terminal-Bench-Science
- Claude Opus 5 набрал лишь 47,0 из 100 в новом бенчмарке SWE Refactor Bench на миграцию кода
- Claude и GPT: учёные оценили «налог на передачу» при смене модели в ИИ-агенте
- ChatGPT делает ответы студентов лучше, а критическое мышление, оригинальнее
- ACE: рамка для генерации данных, на которых обучают ИИ-агентов
- WarpSAC: алгоритм обучения с подкреплением подстраивает стабилизаторы под объём данных
- VBVR-Pro: новый тестовый стенд для визуального мышления ИИ-моделей
- V-Rubrics: рубрики вместо общей оценки учат VLM не выдумывать детали
- Учёные: «направление эмпатии» в нейросети можно найти, но нельзя надёжно включить
- SIMGUIDE обошёл RAG в персонализации ИИ-агентов на GPT-4o и Claude Sonnet 4.5
- LAION выпустила LAION-BVD, открытый датасет из 80 млн видео
- JoyAI-Echo-1.5: система генерации аудио и видео возглавила рейтинг WBench
- Исследователи разработали BPCO, устойчивую замену GRPO для обучения ИИ
- Google представила GlucoFM для анализа данных о глюкозе
- FrontierChallenge: ИИ-агенты доводят до конца лишь 20% научных задач
- DiffusionOPSD: самодистилляция снижает расходы на обучение диффузионных моделей на 40, 63%
- D³-MOPD: динамическое распределение доменов сократило обучение при дистилляции от нескольких ИИ-учителей почти втрое
- AutoSaddler: фреймворк автоматически чинит агентную обвязку и даёт до 10 п.п. прироста
- Agent-G²: гауссова глубина подсказки повысила результаты ИИ-агентов
- Zamba2 и Nemotron-H: нашли «утечку из будущего», которую не видит проверка масок
- Thinkingbox: ИИ-агенты решают бизнес-задачи с первой попытки лишь в 65% случаев
- Роботы-гуманоиды побили рекорд Усэйна Болта в Пекине, но падали и горели
- RENDER: формат подачи диалога определяет результат оценки памяти ИИ
- Recuris: рекурсивная архитектура памяти подняла успешность ИИ-агентов на долгих задачах
- OraRL: новая RL-методика обучения видео-ИИ обошла GPT-5 и Gemini 3 Pro на VSI-Bench
- OPDVR: новый метод совместил дистилляцию и проверяемые награды в обучении LLM
- Multiverse Computing сжала GPT-OSS 120B до 4 бит, модель обошла оригинал
- Исследователи научили ИИ-агентов ставить эксперименты в симуляциях фармпроизводства
- Google представила AgentHands, ИИ-агента с синхронными жестами рук в XR
- Гамильтониан молекулы переписали как лапласиан клеточного пучка
- ESQ-Bench: новый бенчмарк выявил скрытые ошибки NL2SQL-моделей на Oracle