Тема: Исследования
1268 материалов · страница 3 из 26
- ИИ-модель Fable 5.1 разгадала 370-летний шифр Уркварта
- GPT-6 Astra обошла MolmoAct2 в тесте на пространственное мышление
- DeepSWE и Senior SWE-Bench: в бенчмарках для ИИ-агентов нашли методологические ошибки
- DeepMind выпустила AlphaGenome Atlas, карту около 9 млрд вариантов ДНК
- Claude Opus 4.8 и GPT-5.5: фирменная обвязка не даёт устойчивого преимущества в кодинге
- Benchmark Radar объединил поиск, живой каталог и историю оценок ИИ-бенчмарков
- StochBench: агент на Opus 4.8 доказал 34,9% из 450 задач по теории вероятностей
- RCWM восстанавливает сложные 3D-сцены по одной фотографии рекурсивным кодом
- PlannerForge: открытые модели сравнялись с коммерческими в тестах автопилотов
- MIT Technology Review назвал пятерых молодых новаторов в биотехе
- Mi-Ripple избавляет ИИ-отредактированные изображения от «цифровой ряби»
- Конфликт OpenAI с математиками обостряется из-за доказательств теорем
- Исследователи представили GenV, способ ловить скрытые ошибки автоформализации в ИИ
- Исследователи предложили метод аудита предвзятости LLM по скрытым состояниям, в 3, 50 раз дешевле бенчмарков
- Исследователи подняли точность ИИ на редких сущностях на 23,3% за счёт рассуждений и поиска по Википедии
- GLIE сжимает эмбеддинги для поиска по документам и сохраняет почти 80% точности
- Двухлетнее исследование: запрет ИИ на занятиях ухудшает результаты студентов
- DF26: бенчмарк показал, что дипфейки не отличить от реальных видео
- CARDEA: ИИ-модель расшифровывает коронарную ангиографию с проверяемыми обоснованиями
- Бенчмарк IdeaAMBIG: ИИ-модели не находят пробелы в описании методов
- ActReview: нейросеть научили писать дельные рецензии на научные статьи
- X-AuT сжал аудио-энкодер Qwen3-ASR-0.6B почти без потери точности
- World in World: интерфейс позволяет управлять камерой в видео-моделях мира без дообучения
- Выбор токенизатора изображений может повлиять на то, как модель работает с текстом
- UniH3 восстанавливает медицинские снимки разных типов одной моделью
- Tiny Aya L2-Thinker научилась рассуждать на языке вопроса, а не на английском
- SyncWorld научился симулировать действия робота в незнакомой обстановке без дообучения
- Starlink мешает радиотелескопу SKA-Low: помехи в 10 000 раз сильнее сигнала
- SpatialBlock-15k учит нейросети пространственному мышлению через кубики
- RTK не делает ИИ-кодинг дешевле: бенчмарк опроверг вирусные обещания об экономии токенов
- Reflective опубликовала дорожную карту солнечной геоинженерии
- Qwen3-Coder и Gemma 4 деградируют как агенты, копируя эксперта
- Qwen 3.5 на 4 млрд параметров обошла GPT-5.6 в бенчмарке для киосков метро
- Почему нейросетям всё ещё дорого обрабатывать видео: вышел обзор способов ускорения
- NSD: метод самодистилляции учит LLM избегать ошибочных рассуждений
- Nemotron 3 Ultra набрала 30 из 42 баллов на IMO 2026, уровень золотой медали
- MaP-WAM: фреймворк «память как план» для роботов показал рекорд на RMBench
- Экс-вице-президент DeepMind Виньялс: ИИ будет улучшать себя, но без взрыва интеллекта
- DCP проверяет, настоящие ли открытия ИИ-агентов в исследованиях
- Учёные защитили федеративное обнаружение пожара от атак и отказа сервера
- Учёные вычислили формулу грокинга: данные важнее размера модели
- Учёные скрестили готовую диффузионную модель для картинок с топологической оптимизацией конструкций
- Учёные предложили GeoSteer, метод геодезической оптимизации для управления активациями языковых моделей
- T1 решает 64,0% задач Terminal-Bench 2.1 и обходит GPT-5.4 и GLM-5.1
- SWE-Bench Pro Verified: обновлённый бенчмарк показал завышенные оценки ИИ-агентов в написании кода
- PARSER: субагенты читают документ параллельно и ускоряют вывод ИИ-агента до 11 раз
- NCP-ArchPreview сравнялась с OLMo-3-7B, потратив всего 51% токенов
- Исследование: большая часть цепочки рассуждений оказалась лишней для обучения языковых моделей
- Halo повышает точность прогноза временных рядов через оценку неопределённости
- Google представила ToolGrad, метод генерации данных для обучения ИИ работе с инструментами