Тема: Исследования
1268 материалов · страница 16 из 26
- Новый бенчмарк PALATE оценивает ролевых ИИ-агентов через смоделированных пользователей
- Нехватка регистров в x86-64: спиллы слабо предсказывают замедление кода
- MindForge поднял точность Qwen3.6-27B в написании кода с нуля до 49,51%
- Лингвисты нашли утраченный «золотой век» языков человечества
- Explorative Modeling: новая парадигма обучения ускорила обучение генерации изображений в 6,2 раза
- Учёные представили Multi-Head Attention Residuals, раздельное внимание к истории слоёв трансформера
- Техасский университет разработал нейросети без умножений
- Рецензенты рассказали, как ИИ-халтура захватила научные статьи: 68% присланных работ, с фейковыми ссылками или соавторами
- PhiZero: модель физического мира, которая рассуждает на «физическом языке»
- MPIE-Bench: бенчмарк уличил ИИ-редакторы в анатомических ошибках при монтаже нескольких людей
- Microsoft выпустила Echoverse, синтетические миры для тренировки ИИ-агентов
- Microsoft Research представила EvoLib, модели учатся на опыте без дообучения
- Metis: исследователи создали первую базовую модель со встроенной памятью
- KernelGenBench: бенчмарк для оценки ИИ-генерации ядер под разные чипы
- Исследователи масштабировали Memory Decoder до 6,9 млрд параметров памяти
- IBM пополнила трекер квантового превосходства тремя проверяемыми результатами
- Google представила Science One Framework: ИИ-исследования без лживых ссылок
- Frontis-MA1 обошла GPT-5.5 с Codex в тестах на инженерию ML
- Flux-OPD: новый метод дистилляции LLM с эволюционирующим контекстом
- Экс-сотрудник OpenAI поставил $100 млрд на данные для ИИ вместо масштабирования
- Divergence Decoding объединяет ИИ-специалиста и универсала на лету без дообучения
- DeepSeek научил GPT-OSS финансам, но не своей цензуре
- DeepMind: языковые модели не совершат научную революцию, а world models, возможно, смогут
- CoRT: токен-уровневое распределение кредита в GRPO-обучении
- BM25 обходит нейросетевые методы поиска в RAG на больших массивах данных
- Beacon: модель, которая сама решает, когда включать инструменты зрения
- ACE-Data-0: датасет на 17 млн кадров для обучения роботов бытовым задачам
- Замороженные случайные свёрточные сети в RL-агентах сами становятся разреженными
- Wonder: видео-модель мира с управлением камерой и долгой памятью о сцене
- VIPE: визуальный промпт-инжиниринг поднимает точность видеомоделей
- Учёные объяснили, почему RL-обучение сильнее SFT в математических задачах
- TurboVLA: модель для роботов обходится без LLM и уместилась в 1 ГБ видеопамяти
- Почему выводы ИИ-бенчмарков нельзя механически складывать в одну цепочку доказательств
- PerceptionBench проверил зрительное восприятие ИИ: ни одна модель не взяла 60% точности
- NSF запустил пилот четырёхлетних PhD с обязательной практикой в промышленности
- Mage-VL: модель для потокового видео экономит 75% токенов и ускоряет вывод в 3,5 раза
- LLaMA-3-8B дообучили методом MeRLa, RLHF стал на 41% стабильнее
- K-Search перенёс опыт CUDA-ядер на Apple Silicon: Mamba ускорилась в 20 раз
- Исследователи предложили проверять банковские чат-боты цифровыми двойниками клиентов
- ИИ-стартапы-единороги почти не публикуют научные работы
- ИИ проверяет соответствие методов и заявлений в научных статьях
- HumanCLAW: ни одна из девяти VLM не прошла тест на управление телом
- DecoEvo: метод совместной эволюции решателя и оценщика поднял точность LLM на 2,8, 5%
- CodeNib: система контекста репозиториев ускоряет ИИ-агентов кодирования в разы
- ClinLens: новый бенчмарк показал провал ИИ-агентов в клинической аналитике
- CLBench-V: новый бенчмарк показал, что ИИ-модели плохо учатся на мультимодальном контексте
- CAST: игровые решатели стали учителями для ИИ-агентов
- Учёные разложили обучение ИИ-агентов долгосрочному планированию на три стадии
- Учёные нашли скрытый сбой CFG при дистилляции диффузионных моделей и предложили метод PDM
- Transformer Transformer: ИИ сам спроектировал робота и снизил ошибку слежения на 73%