Тема: Исследования
1268 материалов · страница 15 из 26
- Учёные: почти половина ИИ-бенчмарков перестала отличать модели
- Tencent представила Hunyuan3D-Buffalo 1.0, единую модель для 3D-генерации и редактирования
- SKT научил ИИ-агентов увереннее применять готовые навыки (skills)
- PCSD: новый метод самодистилляции обходит GRPO при обучении ИИ-агентов
- PAST-Bench: бенчмарк проверяет, действительно ли ИИ-агенты учатся на своём опыте
- OpenAI Privacy Filter: независимая проверка нашла провалы на кириллице и арабском
- OncoTriad-QA: бенчмарк для ИИ-диагностики рака сразу по снимкам, тканям и генам
- MerchantBench: новый бенчмарк показал разрыв между ИИ-агентами и людьми в e-commerce
- MemArena показал: система памяти важнее размера модели ИИ-ассистента
- DiffusionGemma: диффузионная языковая модель разгоняет генерацию текста до 1500 токенов в секунду
- DAPD: метод дистилляции устраняет «иллюзию привилегий» у языковых моделей
- Цифровые схемы научили самовосстанавливаться после аппаратных сбоев
- Бенчмарк CanItDelete выявил: ИИ-модели избегают удаления кода
- WCM: новая модель-критик учит роботов-манипуляторов предсказывать будущее
- SWE-Touch: бенчмарк выявил провалы ИИ-агентов при правках кода на лету
- SwanTale, модель синтеза речи и звука для нескольких голосов
- Qwen-Image-Edit научили редактировать по нескольким референсам не хуже NanoBanana
- β-OPSD: новый метод самодистилляции делает обучение моделей рассуждению стабильнее
- OpenAI: модель Astra решила или продвинула десять открытых математических задач
- Не длина промпта, а его структура определяет качество ИИ-генерации изображений
- Метод SAF устраняет коллапс энтропии при слиянии RL-наград и дистилляции LLM
- Mental World Modeling: фреймворк, который учит ИИ понимать мысли людей
- MemoryForge: фреймворк синтезирует автобиографическую память для ИИ-агентов
- Σ-Mem: память надёжности учит ИИ-агентов доверять друг другу
- Исследователи представили RubricReviewer, ИИ-рецензента статей с прозрачными критериями оценки
- GPT-OSS 120B и другие дешёвые модели судят доказательства не хуже Claude Opus 4.7
- ExtractBench: LlamaExtract Agentic Plus обошёл коммерческие ИИ-модели в извлечении данных из документов
- DLLM-TTS: блочная диффузия ускорила синтез речи до RTF 0.15
- CAPA: бенчмарк проверяет, помнят ли ИИ-ассистенты кода привычки пользователя
- Andy Pavlo из CMU возглавил новую лабораторию ClickHouse Labs
- SpyRL научил ИИ проверять качество открытых задач через игру в шпиона
- SKL: новый метод учит ИИ-агентов запоминать состояния, а не эпизоды
- Qwen3-VL-8B-Instruct заняла 2-е место в классификации хейт-спича в непальских мемах
- QQWorld: новый метод регуляризации улучшил планирование в world models
- Meta AI создала ИИ-агента-«тренера памяти» для других агентов
- Locksmith Loop: агентный метод проверил перенос COBOL-кода в Java с покрытием 91,9%
- Исследователи предложили LLM-конвейер для поиска крупных математических гипотез с проверкой в Lean 4
- Исследователи описали слоистую архитектуру ИИ-агентов на связке OpenClaw и Ollama
- GPT-5.4 занижает сложность тестовых заданий, выяснило исследование
- GMM и LLM: новый метод балансировки данных для кластеризации текста
- FARS обошла конкурентов больше чем вдвое по оценкам Gemini и Claude в первом бенчмарке автономных ИИ-исследователей
- Chain-of-Models: лучший ИИ-аудитор для предвзятости ИИ-судей зависит от типа ошибки
- BitNet и Mamba: языковую модель уместили в 25 КБ и запустили на BBC Micro на процессоре 1975 года
- AISPA: аудит 88 ИИ-продуктов нашёл вредные инструкции в системных промптах
- Учёные Киотского университета выявили два нейронных контура формирования привычек у мышей
- Persistent State Machines: формальная модель внимания LLM с проверкой на FPGA
- MIT Sloan: финансовые советы нейросетей хороши, но необъективны
- See2Think: бенчмарк выявил, что рендеринг, главное узкое место визуального мышления ИИ
- RefCaptioner: новая модель ИИ точнее описывает видео по референсным снимкам
- OpenAI: модель Astra решила 10 открытых задач по математике