Тема: Исследования
586 материалов
- Закон Гудхарта настиг ИИ-бенчмарки: BIG-bench утёк в GPT-4, а Meta обыграла Chatbot Arena
- Video-DeepResearch обошёл Claude, GPT-5 и Gemini в понимании видео
- Учёные раскрыли физику мультимодального предобучения ИИ
- Учёные предложили перенастроить модели мира: не физика, а обратная связь для ИИ-агентов
- Учёные предложили формат ARA: научные статьи не для людей, а для ИИ
- ToolArtist: модель научили самой решать, рисовать или искать
- Skill-Entropy RL подняла точность моделей Qwen3 на новом бенчмарке Skill²-Bench
- Shopee подняла GMV на пользователя на 1,75% новой моделью рекомендаций
- SA-OPD отсеивает ложные сигналы при дистилляции нейросетей
- OmniPack сокращает вычисления в омни-моделях до 16,7% при 98,0% качества
- MirageBench показал: нейросети выдумывают факты о пользователях
- LLaDA MoE v2 приблизилась к Qwen3, обучившись на 65% токенов предобучения
- Исследование: льстивый ИИ снижает желание мириться, но нравится людям больше
- ContinualSkillBench: агенты учатся в контексте не хуже явных навыков
- AURORA-LM: диффузионная языковая модель обошла аналоги на тестах генерации текста
- Восемь мифов о продуктивности с GenAI в разработке ПО: что показывают исследования
- Учёные выяснили: врачи предпочитают ответы ИИ, которые опасны для пациентов
- Учёные предложили Skill-α, RL-метод генерации навыков для ИИ-агентов
- Учёные: почти половина ИИ-бенчмарков перестала отличать модели
- Tencent представила Hunyuan3D-Buffalo 1.0, единую модель для 3D-генерации и редактирования
- SKT научил ИИ-агентов увереннее применять готовые навыки (skills)
- PCSD: новый метод самодистилляции обходит GRPO при обучении ИИ-агентов
- PAST-Bench: бенчмарк проверяет, действительно ли ИИ-агенты учатся на своём опыте
- OpenAI Privacy Filter: независимая проверка нашла провалы на кириллице и арабском
- OncoTriad-QA: бенчмарк для ИИ-диагностики рака сразу по снимкам, тканям и генам
- MerchantBench: новый бенчмарк показал разрыв между ИИ-агентами и людьми в e-commerce
- MemArena показал: система памяти важнее размера модели ИИ-ассистента
- DiffusionGemma: диффузионная языковая модель разгоняет генерацию текста до 1500 токенов в секунду
- DAPD: метод дистилляции устраняет «иллюзию привилегий» у языковых моделей
- Цифровые схемы научили самовосстанавливаться после аппаратных сбоев
- Бенчмарк CanItDelete выявил: ИИ-модели избегают удаления кода
- WCM: новая модель-критик учит роботов-манипуляторов предсказывать будущее
- SWE-Touch: бенчмарк выявил провалы ИИ-агентов при правках кода на лету
- SwanTale, модель синтеза речи и звука для нескольких голосов
- Qwen-Image-Edit научили редактировать по нескольким референсам не хуже NanoBanana
- β-OPSD: новый метод самодистилляции делает обучение моделей рассуждению стабильнее
- OpenAI: модель Astra решила или продвинула десять открытых математических задач
- Не длина промпта, а его структура определяет качество ИИ-генерации изображений
- Метод SAF устраняет коллапс энтропии при слиянии RL-наград и дистилляции LLM
- Mental World Modeling: фреймворк, который учит ИИ понимать мысли людей
- MemoryForge: фреймворк синтезирует автобиографическую память для ИИ-агентов
- Σ-Mem: память надёжности учит ИИ-агентов доверять друг другу
- Исследователи представили RubricReviewer, ИИ-рецензента статей с прозрачными критериями оценки
- GPT-OSS 120B и другие дешёвые модели судят доказательства не хуже Claude Opus 4.7
- ExtractBench: LlamaExtract Agentic Plus обошёл коммерческие ИИ-модели в извлечении данных из документов
- DLLM-TTS: блочная диффузия ускорила синтез речи до RTF 0.15
- CAPA: бенчмарк проверяет, помнят ли ИИ-ассистенты кода привычки пользователя
- Andy Pavlo из CMU возглавил новую лабораторию ClickHouse Labs
- SpyRL научил ИИ проверять качество открытых задач через игру в шпиона
- SKL: новый метод учит ИИ-агентов запоминать состояния, а не эпизоды
- Qwen3-VL-8B-Instruct заняла 2-е место в классификации хейт-спича в непальских мемах
- QQWorld: новый метод регуляризации улучшил планирование в world models
- Meta AI создала ИИ-агента-«тренера памяти» для других агентов
- Locksmith Loop: агентный метод проверил перенос COBOL-кода в Java с покрытием 91,9%
- Исследователи предложили LLM-конвейер для поиска крупных математических гипотез с проверкой в Lean 4
- Исследователи описали слоистую архитектуру ИИ-агентов на связке OpenClaw и Ollama
- GPT-5.4 занижает сложность тестовых заданий, выяснило исследование
- GMM и LLM: новый метод балансировки данных для кластеризации текста
- FARS обошла конкурентов больше чем вдвое по оценкам Gemini и Claude в первом бенчмарке автономных ИИ-исследователей
- Chain-of-Models: лучший ИИ-аудитор для предвзятости ИИ-судей зависит от типа ошибки
- BitNet и Mamba: языковую модель уместили в 25 КБ и запустили на BBC Micro на процессоре 1975 года
- AISPA: аудит 88 ИИ-продуктов нашёл вредные инструкции в системных промптах
- Учёные Киотского университета выявили два нейронных контура формирования привычек у мышей
- Persistent State Machines: формальная модель внимания LLM с проверкой на FPGA
- MIT Sloan: финансовые советы нейросетей хороши, но необъективны
- See2Think: бенчмарк выявил, что рендеринг, главное узкое место визуального мышления ИИ
- RefCaptioner: новая модель ИИ точнее описывает видео по референсным снимкам
- OpenAI: модель Astra решила 10 открытых задач по математике
- Новый бенчмарк PALATE оценивает ролевых ИИ-агентов через смоделированных пользователей
- Нехватка регистров в x86-64: спиллы слабо предсказывают замедление кода
- MindForge поднял точность Qwen3.6-27B в написании кода с нуля до 49,51%
- Лингвисты нашли утраченный «золотой век» языков человечества
- Explorative Modeling: новая парадигма обучения ускорила обучение генерации изображений в 6,2 раза
- Учёные представили Multi-Head Attention Residuals, раздельное внимание к истории слоёв трансформера
- Техасский университет разработал нейросети без умножений
- Рецензенты рассказали, как ИИ-халтура захватила научные статьи: 68% присланных работ, с фейковыми ссылками или соавторами
- PhiZero: модель физического мира, которая рассуждает на «физическом языке»
- MPIE-Bench: бенчмарк уличил ИИ-редакторы в анатомических ошибках при монтаже нескольких людей
- Microsoft выпустила Echoverse, синтетические миры для тренировки ИИ-агентов
- Microsoft Research представила EvoLib, модели учатся на опыте без дообучения
- Metis: исследователи создали первую базовую модель со встроенной памятью
- KernelGenBench: бенчмарк для оценки ИИ-генерации ядер под разные чипы
- Исследователи масштабировали Memory Decoder до 6,9 млрд параметров памяти
- IBM пополнила трекер квантового превосходства тремя проверяемыми результатами
- Google представила Science One Framework: ИИ-исследования без лживых ссылок
- Frontis-MA1 обошла GPT-5.5 с Codex в тестах на инженерию ML
- Flux-OPD: новый метод дистилляции LLM с эволюционирующим контекстом
- Экс-сотрудник OpenAI поставил $100 млрд на данные для ИИ вместо масштабирования
- Divergence Decoding объединяет ИИ-специалиста и универсала на лету без дообучения
- DeepSeek научил GPT-OSS финансам, но не своей цензуре
- DeepMind: языковые модели не совершат научную революцию, а world models, возможно, смогут
- CoRT: токен-уровневое распределение кредита в GRPO-обучении
- BM25 обходит нейросетевые методы поиска в RAG на больших массивах данных
- Beacon: модель, которая сама решает, когда включать инструменты зрения
- ACE-Data-0: датасет на 17 млн кадров для обучения роботов бытовым задачам
- Замороженные случайные свёрточные сети в RL-агентах сами становятся разреженными
- Wonder: видео-модель мира с управлением камерой и долгой памятью о сцене
- VIPE: визуальный промпт-инжиниринг поднимает точность видеомоделей
- Учёные объяснили, почему RL-обучение сильнее SFT в математических задачах
- TurboVLA: модель для роботов обходится без LLM и уместилась в 1 ГБ видеопамяти
- Почему выводы ИИ-бенчмарков нельзя механически складывать в одну цепочку доказательств
- PerceptionBench проверил зрительное восприятие ИИ: ни одна модель не взяла 60% точности
- NSF запустил пилот четырёхлетних PhD с обязательной практикой в промышленности
- Mage-VL: модель для потокового видео экономит 75% токенов и ускоряет вывод в 3,5 раза
- LLaMA-3-8B дообучили методом MeRLa, RLHF стал на 41% стабильнее
- K-Search перенёс опыт CUDA-ядер на Apple Silicon: Mamba ускорилась в 20 раз
- Исследователи предложили проверять банковские чат-боты цифровыми двойниками клиентов
- ИИ-стартапы-единороги почти не публикуют научные работы
- ИИ проверяет соответствие методов и заявлений в научных статьях
- HumanCLAW: ни одна из девяти VLM не прошла тест на управление телом
- DecoEvo: метод совместной эволюции решателя и оценщика поднял точность LLM на 2,8, 5%
- CodeNib: система контекста репозиториев ускоряет ИИ-агентов кодирования в разы
- ClinLens: новый бенчмарк показал провал ИИ-агентов в клинической аналитике
- CLBench-V: новый бенчмарк показал, что ИИ-модели плохо учатся на мультимодальном контексте
- CAST: игровые решатели стали учителями для ИИ-агентов
- Учёные разложили обучение ИИ-агентов долгосрочному планированию на три стадии
- Учёные нашли скрытый сбой CFG при дистилляции диффузионных моделей и предложили метод PDM
- Transformer Transformer: ИИ сам спроектировал робота и снизил ошибку слежения на 73%
- TimeCapsule: модель обучили только на текстах Викторианской эпохи, чтобы изучить временную предвзятость ИИ
- Теорема Тарского: почему у нейросетей нет «направления правды»
- TBSM: генерация изображений за один шаг по аналогии с рассеянием трёх тел
- Sol-Attn ускоряет генерацию видео нейросетями за счёт разреженного внимания на лету
- ReDesign восстанавливает редактируемый дизайн-макет из картинки
- RARG: агент поиска научили grep-обходу текста по релевантности запроса
- Oxygen-TryOn: новая модель виртуальной примерки одежды обходит GPT-Image-2
- OmniVAE: единый VAE синхронизирует аудио и видео при совместной генерации
- Метод CKM снижает разворот решений ИИ-моделей на 82%, но не повышает их точность
- Kimi Linear впервые обогнала полное внимание на всех задачах
- Исследователи представили llm-wiki-memory-template, шаблон памяти для ИИ-агентов
- HiFi-UMI: точная система сбора данных заменила реальные демонстрации робота
- GrocLM: языковая модель подняла добавления в корзину на 7,5% в продуктовой рознице
- Crystalis: фреймворк научил нейросети строить согласованные многовидовые визуализации
- CaRE: единый протокол оценки диффузионных языковых моделей перевернул рейтинги ремаскирования
- Бенчмарк InMind выявил слепое пятно в памяти ИИ-агентов
- Учёные вывели правило масштабирования для мультимодального предобучения ИИ
- Учёные создали DataPrep-Bench, бенчмарк для оценки ИИ как «сборщика» обучающих данных
- Учёные предложили «пирамиду данных» для обучения роботов физическим манипуляциям
- Skill Self-Play: новый метод самообучения LLM через динамические навыки
- SeT-Diff: диффузионная модель научилась предсказывать показания датчиков суперкомпьютеров
- QFoldAgent: мультиагентная система квантовой оптимизации улучшила предсказание структуры белка
- Opus 5 прошёл 24% контрольных точек SlopCodeBench, но код стал многословнее
- OpenAI выяснила: 43,5% задач в ChatGPT, вне профессии
- Метод дистилляции протоколов научил Qwen3 конкурировать с закрытыми ИИ в поиске
- Исследование: нейросети путаются в ответах при перефразировке вопроса, расхождение свыше 23%
- GAND: новый бенчмарк для оценки гендерных предубеждений при машинном переводе
- C-VCE, диффузионный метод, который объясняет решения ИИ на языке понятий
- AMD показала «тетраэдральные клетки» для рейтрейсинга анимированной геометрии
- 7B-модель с агентным конвейером обошла Claude Sonnet 4.5 и Gemini 3.1 Pro в медицинской диагностике
- Учёные пересадили свиньям почки, охлаждённые до −4 °C без льда
- TILT улучшает точность diffusion-моделей в сложных запросах
- Spectral Flow Certificates выявляют топологические ограничения GNN до обучения
- Плазменные туннели показали риски сгорания спутников в атмосфере
- Исследователи предложили прогнозировать задержки LLM на edge-устройствах
- Исследователи предложили монотонно оценивать сигналы риска лесных пожаров
- Исследование описало шесть сбоев жестового управления в публичных киосках
- HierFlow предложила поиск рабочих процессов для ИИ-агентов без обучения
- Experience Distillation переносит опыт ИИ-агентов в веса модели
- Encord и Zander тестируют нейросигналы для обучения роботов
- Джон Бэкус: опубликован черновик истории его функционального проекта
- Cornell Tech показал оптическое обновление памяти для ИИ-роботов
- BAIR предложила ABBEL для обучения нейросетей на длинных диалогах
- AgentKVShift ускоряет KV-кэш для памяти ИИ-агентов
- Стэнфордский обзор: ИИ пока слабо влияет на занятость
- SETI и NASA нашли следы древних рассолов в метеорите из Нью-Джерси
- Учёные представили SDM, модель, которая различает движение камеры и объектов в видео без разметки
- SANA-Video 2.0 ускорила генерацию видео в 120 раз с гибридным вниманием
- На Hacker News смоделировали закрытие Ормузского пролива на данных о торговле нефтью
- MIT возродил патент 1985 года и создал трёхстороннюю молнию Y-zipper
- ИИ-модели теряют нить, когда пользователь меняет намерение по ходу диалога
- Color Pass-Through точнее передаёт цвет от камеры смартфона к экрану
- ARC-AGI обновили до версии 3: бенчмарк для ИИ-агентов в интерактивных средах
- Учёные вывели законы масштабирования для гиперсетей, внедряющих знания в языковые модели
- Учёные доказали: естественный язык не может полностью заменить языки программирования
- Учёные: детализация персоны не делает мнения языковых моделей разнообразнее
- Tencent выпустила WorkBuddy Bench, бенчмарк для кодинг-агентов, задачи которого нельзя найти в интернете
- Rubric4Setwise обошёл 12 ранжировщиков в подборе документов для RAG
- RIPO: новый алгоритм RL обошёл GRPO в тесте AIME24 (до 60%)
- ReferTrack: метод научил робота следить за целью по камере
- ProVisE: фреймворк оценивает пространственное мышление генеративных моделей через пиксели
- Новый метод VCSD поднял точность моделей Qwen3-VL и Qwen3.5 без внешнего учителя
- Новый метод EAACD снижает галлюцинации LLM в MoE-моделях
- Moir защищает математику и код нейросетей при редактировании знаний
- Маршрутизация MoE-моделей оказалась кодированием Хаффмана
- LLM-INSTRUCT выиграла конкурс по анализу аргументации на ArgMining 2026
- K12-KGraph: граф знаний школьной программы Китая выявил пробелы у ИИ-моделей
- GPT-5.5 и Claude Fable 5 провалили бенчмарк на активное зрение ActiveVision
- ESO, возможно, нашла первую экзолуну за пределами Солнечной системы
- DeepSeek ценит структуру и голос текста выше словарного запаса
- AstraZeneca рассказала, как ИИ ускоряет разработку лекарств нового поколения
- AREX, рекурсивно самоулучшающийся ИИ-агент для глубокого поиска
- Anchor-Align повышает успешность ИИ-роботов после дообучения
- AlphaAgent, ИИ-агент для анализа статей по материаловедению
- Учёные научили генеративные рекомендации учитывать несколько целей без переобучения модели
- Учёные нашли «внутренние часы» в диффузионных языковых моделях
- Учёные нашли скрытые «регистры смысла» в диффузионных трансформерах и ускорили генерацию на 20%
- Self Gradient Forcing: новый метод обучения нейросетей для генерации видео произвольной длины
- SciForma: новая модель точно рисует научные диаграммы без ошибок в структуре
- OpenAI вложит $7 млн и предложит мэтчинг API до $10 млн в Genesis Mission Минэнерго США
- MIT создал бенчмарк Beaver: точность text-to-SQL на реальных базах, 10, 30% против 80%+ в тестах
- LLM почти не отличают надёжные источники от просто популярных, показало исследование
- LISA: гибридное внимание ускоряет вывод reasoning-моделей на 50%
- HPD-Parsing ускоряет разбор документов ИИ в 2,62 раза
- Google выделил $40 млн на ИИ для научных лабораторий Genesis Mission
- Google научила квантовый чип Willow калиброваться во время вычислений
- Google научила ИИ-агента SymptomAI ставить диагнозы точнее врачей
- FormulaSpin научил модели точнее писать формулы для таблиц через самоигру
- Эксперимент: ИИ-лаборатории не подгоняют модели под тест «пеликан на велосипеде»
- DeepSeek-V4 дообучили на Huawei Ascend в 2.93 раза эффективнее
- AutoIndex учит ИИ-агентов оптимизировать индексацию документов и поднимает точность поиска до 30%
- AlayaRenderer-Flash ускорил генеративный рендер игровых миров до 30 FPS
- ABot-World-0: интерактивная видео-модель мира стримит на одной GPU
- 3D-Fit: новый бенчмарк показал, что LLM пока отстают от диффузионных моделей в дизайне молекул
- Учёные предложили «коэффициент джинна», метрику того, насколько ИИ-агент верно понимает просьбы
- ToolDNS: исследователи предложили искать ИИ-инструменты через DNS
- TimeLens2: модель на 8 млрд параметров обошла ИИ с 397 млрд в поиске момента видео
- SWE-Pruner Pro обрезает контекст ИИ-агента и экономит до 39% токенов
- SAT: метод для устойчивого асинхронного обучения с подкреплением LLM
- SAAG: фреймворк находит, где именно ИИ-агенты ошибаются при вызове функций
- RynnBrain 1.1: модель для роботов обошла конкурентов в тестах на пространственное мышление
- Представлена GigaChat Audio, ИИ-модель с таймкодами для 120-минутных записей
- Phionyx: детерминированная архитектура ИИ-рантайма снижает издержки на 31%
- Open-AoE: исследователи выпустили открытый датасет из 2000 часов видео для обучения роботов
- MILP-Evo: языковая модель сама проектирует части решателя MILP-задач
- Mage-Flow: модель на 4 млрд параметров генерирует изображение за 0,59 секунды
- Исследователи представили EvolvingWorld: фреймворк для эволюции ИИ-персонажей и миров
- ИИ-помощник JudgeGPT на GPT-4 поднял производительность судов Пакистана на 6,3%
- HKUST представила HOMIE, ИИ для точной вставки людей и предметов в видео
- FlowMimic: новый метод генерирует данные для редактирования видео без масок
- Evidence Chain Evaluation научил ИИ-фактчекер честно говорить «не уверен»
- DeepSearch-World: ИИ-агент для поиска в интернете научился улучшаться сам, без учителя
- BatchDAG: ИИ сам строит графы запросов и сокращает вызовы LLM в 47 раз
- Apple-PI: бенчмарк проверил, понимают ли видео-нейросети законы физики
- AlayaWorld: модель на 15 млрд параметров генерирует интерактивные видео-миры
- Языковые модели показывают устойчивое отношение к риску
- Учёные представили GOI, метод автоматического построения онтологий из документов
- Учёные описали новый источник смещения в данных RLHF: состояние разметчика
- Taobao запустила RecGPT-V3: система рекомендаций экономит 52,4% вычислений
- RxBrain: модель, которая планирует действия роботов через язык и визуальное воображение
- RHI: рекурсивная самонастройка агентной «обвязки» экономит до 60% на инференсе
- RESOURCE2SKILL превращает видеоуроки и статьи в навыки для ИИ-агентов
- ReflectWorld-MM: система памяти для видеоагентов обошла конкурентов на 6 тестах
- RAGU: 7B-модель Meno-Lite-0.1 обошла Qwen2.5-32B в построении графов знаний
- Qwen Coder 3B возглавил бенчмарк малых языковых моделей для локального ИИ
- OPD²: новый метод дистилляции ускоряет перенос reasoning в ИИ-моделях
- Около трети новых статей на arXiv теперь читаются как написанные ИИ
- Loopie: зацикленный трансформер взял золото IMO и IPhO без инструментов
- Исследователи представили GEPO, улучшение GRPO для RL-обучения ИИ на разнородных задачах
- Исследование на шахматах показало: предобучение определяет пользу RL для ИИ-рассуждений
- ИИ-агенты ускоряют код-ревью, но не делают его лучше
- Claude Fable нашла контрпример к столетней гипотезе Якобиана
- ChatGPT, Claude и Gemini предвзято судят кандидатов сильнее людей
- xHC: остаточный поток трансформеров расширили до 16 линий
- Вышел большой обзор методов самосовершенствования ИИ-агентов
- UniVR: новая модель улучшила визуальное рассуждение на 25%
- Учёные: советы ИИ снижают точность людей, но повышают уверенность
- Учёные построили вероятностный компьютер на 1 млн p-бит
- Учёные: генерация квантовых программ ИИ требует верификации, а не масштаба
- Найдена структура ошибки при подмене Фурье-свёртки свёрткой Адамара
- Исследователи представили SC-CMJP, фреймворк для совместной генерации текста и изображений с автокоррекцией
- GraphDx: мультиагентный ИИ с графом знаний поднял точность диагностики до 93%
- Google DeepMind научила видеогенератор решать несколько задач компьютерного зрения
- Causal-Audit: причинный вывод LLM сделали прозрачным и проверяемым
- Black Myth: Wukong стал источником датасета для ИИ-моделей игровых миров
- Аккаунт в X: Claude нашёл контрпример к гипотезе Якобиана
- В цифровом «первичном бульоне» самовоспроизведение и вычисления эволюционировали совместно
- Математики до сих пор не знают, как быстрее всего перемножать числа
- GPT-5.6 закрыла 30-летний пробел в теории выпуклой оптимизации
- GPT-5.6 и DeepSeek-R1: как LLM научили переключать уровень рассуждений
- Claude Fable 5 обошёл GPT-5.6 Sol в тесте на NP-трудной задаче: режим /goal почти не помог
- AMA: 61% врачей США боятся роста отказов в страховых выплатах из-за ИИ
- VentureBeat: 57% компаний столкнулись с ошибками ИИ-агентов из-за плохого контекста
- Статические деревья поиска: бинарный поиск ускорили в 40 раз
- MultiRef-Compass: бенчмарк для генерации аудио-видео по нескольким референсам
- LongStraw: RL-обучение ИИ-агентов на контексте свыше 2 млн токенов при фиксированном бюджете GPU
- Исходный код ELIZA, первого чат-бота, нашли в архивах MIT
- Доклад «State of Open Source AI»: открытые модели обогнали закрытые по трафику
- Ян Лекун: LLM не дорастут до человеческого интеллекта, ставка смещается на мировые модели
- Учёные предложили трёхуровневую архитектуру обучения для роёв дронов-спасателей
- Учёные Northwestern создали дрон Phantom Twist, почти невидимый в полёте
- SEED: новый метод обучения ИИ-агентов извлекать уроки из своих же попыток
- Qwen2.5-Coder и Qwen3: промежуточное дообучение подняло точность кодовых агентов на SWE-Bench
- MetaView, синтез новых ракурсов сцены по одному фото
- IMEX, метод, объясняющий предсказания ИИ-моделей через взаимодействия признаков
- HG-RAG: иерархический обход графов знаний точнее плоского RAG
- Harness Handbook: способ быстрее находить нужный код при правке ИИ-агентов
- GPT-4o, Gemini 2.5 Pro и Qwen3-VL по-разному теряют устойчивость при повторных вопросах
- Xiaomi представила Robotics-U0, модель генерации видео для роботов, занявшую 1-е место в World Arena
- SynthDocBench выявил слабые места VLM в длинных документах
- Соавтор Face ID привлёк $52 млн на нейросеть для диагностики мозга по ЭЭГ
- SearchGen-Bench вскрыл провал ИИ-генераторов изображений на новых фактах
- Ring-2.5-1T-Zero: нейросеть на триллион параметров научилась рассуждать без разметки человеком
- PolicyShiftGuard: ИИ-модель научили применять разные политики модерации изображений
- Патентное право ЕПВ заставляет детекторы ИИ-текста путать людей с нейросетями в 60, 80% случаев
- OriginBlame точно находит данные для удаления из ИИ-моделей
- Новый метод дообучения ИИ на порядки снижает углеродный след
- KnowAct-GUIClaw обошёл GPT-5.5 в тесте на управление смартфоном
- Исследователи предложили SpectraReward, метод оценки для дообучения text-to-image моделей без готовых наград
- ИИ уступает годовалому ребёнку: Meta и Стэнфорд представили тест EgoBabyVLM
- GPT-5.6 Sol Pro опровергла 30-летнюю гипотезу статистики за 90 минут
- Google объяснила математику «творчества» диффузионных моделей
- Generative SNUPI: нейросеть проектирует ДНК-оригами по эскизу
- FixItFlow ускорил устранение облачных инцидентов в 2,3 раза с помощью ИИ
- «Бросок решает прицел»: эссе сравнивает LLM с героем блюз-песни D-A-D
- Учёные обучили нейросети без «взгляда в будущее»: качество почти как у Gemma-3-4B и LLaMA-7B
- StudioRecon восстанавливает 4D-сцены с людьми по редким камерам
- Qwen3-1.7B прокачали с 48% до 58% на AIME 2024 RL-сигналом от слабой модели
- PsiQuantum готовит гигантский квантовый компьютер на фотонах
- Проект Star Fleet Math на GPT-5.6 решил две задачи Эрдёша с помощью до 20 параллельных агентов
- Крупные языковые модели не справляются с переводом в Брайль
- Исследователи нашли утерянный код чат-бота ELIZA, и разгадали, почему мы доверяем ИИ свои секреты
- G-SHARE: ИИ находит человеческий фактор в отчётах АЭС
- Энтузиаст воссоздал JEPA-архитектуру Лекуна и обучил её на Super Mario Bros, предсказывает игру, но не проходит
- БМР зафиксировал переход ИИ-инвестиций с денежных потоков на долг
- Бенчмарк CANDI-QA показал слабость ИИ-моделей в медицине и финансах
- Anthropic нашла новое окно во «внутренние мысли» Claude
- Учёные создали сверхсплав, который вдвое прочнее стали
- Профессор Принстона Аравинд Нараянан: работу у нас не заберут, но изменят до неузнаваемости
- Новое исследование: рекурсивное самоулучшение ИИ пока не наступило, нужно 15%, есть 9%
- Нобелевские лауреаты и главы OpenAI, Anthropic, Google предупредили об угрозе ИИ для экономики
- Microsoft изучила внедрение Claude Code и Copilot CLI: +24% к мержам PR
- MedGemma научили обосновывать ИИ-диагнозы по модели Тулмина
- Ludus Coriovalli: ИИ восстановил правила древнеримской настольной игры спустя 1800 лет
- LightMem-Ego: лёгкая ИИ-память для смартфонов и умных очков запоминает день пользователя
- Исследователи представили AuditWeave, защищённый от подделки журнал аудита ИИ-решений
- Исследователи: «эталонные данные» в ИИ, не объективная истина, а решение людей
- Исследование: формат сообщений между ИИ-агентами решает исход только для слабых моделей
- GenCeption: модели генерации видео заменяют специализированные системы зрения
- Формат промпта способен исказить рейтинги LLM-бенчмарков в разы
- Anthropic обнаружила у Claude «J-пространство»: что это доказывает, а что нет
- ABot-N1: модель навигации роботов побила рекорды точности
- Знаковая симметричная квантизация: точность асимметричной схемы по цене симметричной
- Учёные в свободное время скрестили генеративный ИИ с квантовым компьютером, и научились точнее предсказывать пептиды для вакцин
- Учёные свели задачу устойчивости нейросетей к атакам к обходу решётки интервалов
- Учёные объяснили общий механизм дистилляции знаний в больших языковых моделях
- Против полезности: венчурный инвестор ищет тех, кто работает не ради денег
- Претрейн на изображениях документов обходит текстовый претрейн языковых моделей
- Механистическая интерпретируемость: исследователи применяют теорию причинности, чтобы понять, как рассуждают языковые модели
- Long-Horizon-Terminal-Bench: бенчмарк проверяет ИИ-агентов на многочасовых терминальных задачах, лучшие модели решают меньше 11%
- LinkedIn, безоговорочный лидер по ИИ-мусору в длинных постах: исследование пяти площадок
- Классификация и сравнение языков описания архитектуры ПО (ADL)
- Как открытые данные могут починить оценку налога на недвижимость в округе Аллегейни
- iLENS: интерпретируемая LLM-управляемая смесь экспертов для прогноза болезни Альцгеймера по нейровизуализации
- HALO: гибридная адаптивная доработка скрытых состояний языковых моделей
- DrugGen-2: генеративная модель для разработки лекарств с учётом контекста заболевания
- CogniConsole: надёжность LLM зависит не только от мощности модели, но и от контроля на этапе вывода
- Автор блога проверил тезис книги «Изобилие» о жилищном дефиците на реальных данных, и нашёл случай, который его ломает
- Автоматизация без понимания: ИИ уже доказывает теоремы, а США сворачивают подготовку математиков
- Современные интерьеры могут перегружать мозг
- Ранняя история сингулярного разложения матриц
- Простые жидкости, оказывается, тоже могут трескаться, как стекло
- Планета размером с Юпитер, пережившая смерть своей звезды, преподнесла астрономам новую загадку
- Оценки упали с 96 до 48 процентов, когда профессор Университета Брауна заставил студентов сдавать экзамен без ИИ
- Миллиарды рисунков раскрывают скрытые культурные различия в человеческих понятиях
- ИИ-агенты стали выигрывать в Slay the Spire 2 после того, как исследователи заменили растущие логи чата структурированной памятью
- Это ИИ-паутина, а мы в ней, просто крысы в стенах
- Энергетические затраты клеточных вычислений (2012)
- Зубы морских блюдечек оказались прочнее паучьего шёлка, самый прочный природный материал (2015)
- Вычисление как универсальное и фундаментальное понятие
- UniClawBench: бенчмарк для оценки проактивных ИИ-агентов в реальных задачах
- Теория относительности Эйнштейна управляет химическими связями тяжёлых элементов, новое исследование
- PDF на CDN OpenAI выдают за доказательство полувековой гипотезы теории графов от «GPT-5.6 Sol Ultra»
- LongE2V: восстановление, предсказание и интерполяция видео из данных событийных камер с помощью диффузионных моделей
- Коррекция квантовых ошибок может служить одновременно и постоянной калибровкой процессора
- Гибридные логические часы: как совместить причинность и физическое время в распределённых базах данных
- Беззвучную речь научились распознавать по ультразвуку языка
- Anthropic нашла в Claude скрытое «пространство раздумий»
- Video-Oasis: половина бенчмарков для видео-ИИ решается вообще без видео
- У идей есть геномы: бенчмарк проверяет, умеет ли ИИ прослеживать «родословную» научных идей
- SensorFM: универсальная модель Google для данных с носимых устройств здоровья
- SciReasoner: единая модель ИИ для «прозрачного» предсказания свойств по структуре в биологии, химии и материаловедении
- ReCoLoRA: рекурсивная консолидация LoRA-адаптеров с учётом спектра весов для последовательного дообучения LLM
- «Почему я не могу открыть свой ящик?»: как отучить модели распознавания действий от подсказок по объекту
- От лаборатории к практике: авторы представили обновлённую VLA-модель для роботов LingBot-VLA 2.0
- Omni-Sleep: базовая модель сна на связке ЦНС и вегетативной нервной системы
- LLT: локально-линейный трансформер для решения уравнений в частных производных
- LingBot-World 2.0: бесконечные виртуальные миры с гибким взаимодействием
- Кого теряет порог решения: недодиагностика редких подгрупп при классификации рентгена грудной клетки
- Как объяснить решения временных графовых сетей: метод MemExplainer заглядывает в их «память»
- JD Oxygen AI Item Center (Oxygen AIIC) v1: промышленная LLM/VLM-платформа для товарных данных JD.com
- ИИ-мусор в текстах захватил соцсети, особенно LinkedIn и X
- Двойная латентная память для моделей «видение-язык-действие» в роботизированных манипуляциях
- CanvasAgent: агент, который учится сам подбирать визуальные инструменты для сложного создания и редактирования изображений
- Anthropic нашла в Claude скрытое «пространство», где модель обдумывает понятия до ответа
- TriRoute: единая обучаемая маршрутизация внимания, MoE-экспертов и KV-кэша
- RynnWorld-Teleop: модель мира, управляемая действиями, для «цифровой телеоперации» роботов
- RynnWorld-4D: 4D-модель мира воплощённого ИИ для роботизированной манипуляции предметами
- Правила транслитерации Unicode оказались тьюринг-полными
- Параллельное авторегрессионное декодирование для омнимодального плотного описания видео
- OpenAI: аудит показал, что около 30% задач в бенчмарке SWE-Bench Pro сломаны
- Незаметный сбой в калиброванном виртуальном скрининге: маргинальное конформное предсказание даёт заниженное покрытие для миноритарного класса, а классово-условная поправка это устраняет
- NEST: архитектура смеси экспертов по операционным режимам против сдвигов распределения в датасетах
- MORP-DRL: глубокое обучение с подкреплением для двухцелевой оптимизации портфеля на основе надёжности
- LLM-репетитор: адаптивная сложность промптов для RL-обучения без проверяемых ответов
- HiLS-Attention: иерархическое разреженное внимание для сверхдлинного контекста в языковых моделях
- DSpark: спекулятивное декодирование с верификацией по уверенности и полу-авторегрессионной генерацией
- Databricks сравнил ИИ-агентов для написания кода на своей кодовой базе из миллионов строк
- D2PO: новый способ обучать диффузионные сэмплеры, через предпочтения, а не имитацию учителя
- Анализ тональности речи через дистилляцию знаний и кросс-модальную интеграцию сгенерированных многоязычных транскриптов
- Vision as Unified Multimodal Generation: как SenseNova-Vision свела всё компьютерное зрение к генерации текста и картинок
- Учёные сравнили методы сжатия KV-кэша для LLM, и коэффициент сжатия оказался плохим предсказателем качества
- Статистически содержательная геометрия и нарушение калибровочной симметрии: геометрическая основа научных открытий и возникновения интеллекта
- Сила сотрудничества: как Google Maps снижает дорожные заторы
- SaMer сжимает визуальные токены для поиска по картинкам в 16 раз, и находит нужное точнее
- PixWorld: генерация и реконструкция 3D-сцен в едином пиксельном пространстве
- OmniOpt: таксономия, геометрия и бенчмарк современных оптимизаторов
- MANCE: удаление концептов из представлений моделей с учётом их многообразия
- Малые ИИ-модели набирают популярность по всему миру
- Light-Omni: рефлекс вместо рассуждений в агентном понимании видео с долговременной памятью
- KVpop: сжатие KV-кэша через обучаемое предиктивное отсеивание токенов
- Классификация текста без обучения: учёные предложили меру расстояния на основе вложенных повторов
- Как персона агента влияет на поведение ИИ в игре «Делись или воруй»
- InternVLA-A1.5: единая модель понимания, скрытого предвидения и действия для роботов
- Интеллект дешевеет до нуля: что это значит для систем управления данными в эпоху ИИ-агентов
- Design-CP: контекстный параллелизм для дизайна белковых наночастиц
- VLA-Corrector: как научить робота исправлять ошибки во время действия
- Учёные впервые использовали точное редактирование генов для изучения развития человеческого эмбриона и нашли главный ген
- Скрытое пространство мышления: как учёные Anthropic открыли внутренний «разум» Claude
- ResearchStudio-Idea: система для научных идей, основанная на анализе конференций
- OrbitQuant: универсальная квантизация для быстрой генерации видео и изображений нейросетями
- Монотонное улучшение политик вывода: решение проблемы тренировки нейросетей на подкреплении
- Квантовые компьютеры и ИИ суперкомпьютеры помогут решить проблему производства топлива для термоядерных реакторов
- GigaWorld-1: как тестировать модели для управления роботами без дорогостоящих экспериментов
- Федеративное обучение для распознавания объектов: обучение дронов без централизации данных
- DataComp-VLM: открытый эталон для улучшения датасетов в мультимодальных моделях
- Акустическая машина Изинга на 2048 спинах решает задачи оптимизации: альтернатива оптическим системам
- Разрыв каскадов ошибок: пошаговое обучение с подкреплением для медицинского мультимодального рассуждения
- Потерянные 500 миллионов лет: как космическая бомбардировка расплавила первую кору Земли
- Новый AI-репетитор показал эффект 0,71, 1,30 сигма в курсе Дартмута
- Две стороны случайности: энтропия Шеннона и сложность Колмогорова
- Baidu обучила модель OCR, обрабатывающую десятки страниц за один проход благодаря методу скользящего окна внимания
- AutoMem: Автоматическое обучение памяти как когнитивному навыку
- «За пределами лимита»: спутники и зеркала на орбите угрожают ночному небу
- NASA ищет добровольцев на год изоляции: в чём подвох
- Медузы заживляют раны за минуты. Учёные разгадывают их секреты
- Марсоход Perseverance обнаружил на поверхности скалы загадочный углерод
- Когда теряется обоняние: почему потеря запаха ломает жизнь и как это связано с мозгом
- Интенсивный курс по автономии дронов: от теории к практике
- Атомно-силовой микроскоп в действии: травление, бактерии и наномир
- Выпуск 2026 Лаборатории ИИ Беркли: 30+ докторов с исследованиями в робототехнике, LLM и зрении
- Узкое место может быть в воздухе помещения
- Устройство ECaBox возвращает жизнь донорским глазам для трансплантации
- Синтез сложнее анализа: почему интегрирование труднее дифференцирования
- Охота на 16-летний баг SQLite с помощью TLA+: уязвима ли dqlite?
- MrFlow: 10-кратное ускорение генерации изображений без обучения
- Исследование: почему люди ошибаются при чтении по губам
- Исследование 26 000 студентов: скрытая стоимость обучения с ИИ проявляется через два года
- Google DeepMind и A24 объявили о первом в своём роде исследовательском партнёрстве
- Гигантские деревья легко прокачивают воду на вершину
- EvoPolicyGym: оценка эволюции автономных политик в интерактивных средах
- Anthropic запустила программы разработки лекарств для болезней, которые Big Pharma считает убыточными
- AgenticDataBench: новый бенчмарк для оценки ИИ-агентов анализа данных
- Якоря в промптах искажают оценку LLM: F1-инфляция и миф о качестве
- SPARCLE: отзывчивые к дикторам графемные представления через контрастивное обучение
- Program-as-Weights: программирование нечётких функций как нейросетевых артефактов
- PerceptionRubrics: калибровка оценки мультимодальных моделей под восприятие человека
- Kara: быстрое обслуживание LLM с длинными рассуждениями через сжатие кэша
- Использование DSPy для оценки и улучшения системных промптов Datasette Agent
- FlashMorph: автоматический выбор слоёв при преобразовании Transformer в гибридную модель с разнородным вниманием
- DART: адаптация робототехнических моделей к новым условиям через векторную арифметику
- Чрезвычайная ситуация с приватностью в США: запрет на защиту данных
- CausalMix: оптимизация смешивания данных при обучении языковых моделей через причинно-следственный вывод
- AMVL: новая техника обучения мультимодальных LLM для непрерывного рассуждения
- Впервые клетка, собранная с нуля, начала расти и делиться
- Senior SWE-Bench: открытый бенчмарк для оценки ИИ-агентов как опытных инженеров
- Сцена как объекты: новый способ разбирать 3D-миры на части без предварительной разметки
- Персона без субстрата: зависимость от режима и проблема индивидуации LLM
- Ограниченная мораль: формализация пространства морального вычисления
- Многоблочные диффузионные языковые модели: параллельная генерация текста без потери качества
- MemLearner: Обучение запросу контекста для видеомоделей мира
- Loom: управляемое повествование для улучшенного ассистирования писателям
- Конструктивное согласование: управление динамикой предпочтений в взаимодействии человека и ИИ
- Как учить ИИ-агентов повторяющимся работам: новый бенчмарк для оценки процедурной памяти
- GeneBench-Pro: бенчмарк OpenAI для оценки ИИ-моделей на генетических задачах
- Evolution Fine-Tuning: учим LLM искать решения через эволюционный поиск
- Brain2Qwerty v2: неинвазивный интерфейс мозг-компьютер Meta сокращает разрыв с имплантатами
- Video-MME-Logical: бенчмарк для проверки логического мышления видеомоделей
- Табулярные фундаментальные модели: как они работают на сложных данных
- SkillOpt: как научить агентов ИИ правильно действовать без переобучения модели
- Сегментация видео роботов на действенные подзадачи: WGO-Bench и практика автоматизации
- Почему специализация неизбежна: математика, эволюция и ИИ
- Ортогонализация матриц улучшает память в рекуррентных моделях
- MetaFlow: обучение больших языковых моделей генерировать рабочие процессы без примеров
- Meta создала систему для преобразования мозговых волн в текст без хирургии
- Когда обратная связь реально улучшает ИИ-агенты: контролируемое исследование на 13 моделях
- Когда агент должен остановиться? Исследование agentic abstention
- Иерархическое глобальное внимание (HGA), расширение контекста трансформеров без переобучения
- Google выпустил данные о отражательности крыш для 50+ городов мира
- GeneBench-Pro, бенчмарк для ИИ в биологии и геномике
- DOPD: двойственная дистилляция на основе обучающей политики
- BlockPilot: адаптивное управление размером блока для ускорения диффузионного декодирования
- Anthropic запустила Claude Science, рабочую среду ИИ для учёных
- Жидкие сети как неизбежность: математическое доказательство необходимого субстрата для децентрализованных агентов
- SingGuard: адаптивный guardrail для мультимодальных LLM с динамическими правилами
- Симуляторы в RL-исследованиях: различие между решением симулятора и обучением для реального мира
- ReFreeKV: метод сжатия KV-кэша без порогов
- Поколение языков в пределе: новая модель с допуском на ошибки
- Нейронный фильтр Калмана для совместной оценки состояния в распределённых системах
- Могут ли нейросети рисовать науку? Бенчмарк для оценки генерации научных диаграмм
- LiveEdit: редактирование видео в реальном времени через диффузию
- Компании, интенсивно внедряющие ИИ, нанимают быстрее, включая junior-позиции
- Карта возможностей рынка труда ЕС в эпоху ИИ
- Как видеомодели ИИ проваливаются на редких физических взаимодействиях
- DiScoFormer: один трансформер для плотности и сметки, на любых распределениях
- AsyncOPD: как быстро обновлять учителя в обучении больших моделей
- Apple Neural Engine: архитектура, программирование и производительность
- Учёные создали пиксель, умеющий одновременно испускать и получать свет
- Трансляция как мост между человеком и роботом: обучение манипуляциям через действия
- Только три ИИ-модели остались в плюсе в 500-дневном тесте управления стартапом
- Термин «машинное разучивание» переиспользуют в исследованиях больших языковых моделей
- RANSAC правильно: как оценивать качество моделей без пользовательских параметров
- Почему журнал отозвал две статьи Макса Планка 1940-х годов?
- PhysisForcing: когда видеомодели учатся физике манипуляции роботов
- OverFlowLight: система предотвращения транспортных пробок и оптимизации светофоров в городе
- Fast LeWorldModel: параллельное предсказание для визуального планирования
- Дистилляция знаний от чёрных ящиков больших языковых моделей
- Четыре аксиомы внутреннего представления мыслей в больших языковых моделях
- AI-Model Network: сеть для взаимодействия и сотрудничества моделей ИИ
- Talos: автоматическая переаналитика генома в диагностике редких болезней
- SPEX: алгоритм для поиска взаимодействий в больших языковых моделях
- Современные ИИ-системы превосходят людей в убеждении, стремящихся к искусственному сверхинтеллекту
- MVTrack4Gen: отслеживание точек для генерации видео с новых ракурсов
- Кем быть математику, когда математику делает ИИ
- Как сделать нейросетевые модели мозга понятными: GCT от Microsoft Research
- Как Ozempic влияет на ось кишечник, мозг
- JP Morgan предупреждает о множестве рисков на рынке ИИ
- JetSpec: преодоление потолка ускорения спекулятивного декодирования параллельным черновиком
- ИИ осваивает «чёрное искусство» проектирования РЧ схем
- Хакирование социума, РСИ в Anthropic и дроны-чемпионы: три исследования о способностях ИИ
- GUI против CLI: в чём потеря производительности компьютерных агентов
- GRASP: планирование на длинных горизонтах в обученных динамических моделях
- Горизонт верификации: нет серебряной пули для вознаграждений ИИ-агентов кодирования
- Адаптивное параллельное рассуждение: как языковые модели учатся решать задачи эффективнее
- 50 исследовательских работ по LLM: что читать в 2026 году
- ViQ: унифицированные текстово-визуальные представления при любом разрешении
- Тепловые волны влияют на мозг. Учёные разбираются, почему
- Полная расшифровка микросхемы IBM MCGA: энтузиаст воссоздал схемотехнику видеочипа 1987 года
- Почему кинетическая энергия растёт квадратично, а не линейно со скоростью?
- Первое подробное изображение мозга человека через череп с помощью ультразвука
- На сколько месяцев открытые LLM отстают от закрытых: анализ тренда до конца 2026 года
- Как агенты преобразуют работу: исследование экономического потенциала Codex в OpenAI
- In-Context World Modeling: как роботам научиться адаптироваться к новым условиям без переобучения
- ИИ в математике переворачивает профессию: машины вместо доказательств
- Впервые полностью прочитан древний свиток из Геркуланума без его открытия
- Un-0: генерирование изображений с помощью связанных осцилляторов
- Улучшенные диффузионные языковые модели с двусторонним вниманием
- Полезность вредит: доменно-зависимая деградация ценностей сострадания при постобучении
- Мышление как припоминание: как рассуждение раскрывает параметрические знания в LLM
- Know2Guess: бенчмарк для оценки границ знаний в больших языковых моделях с учётом загрязнения данных
- Какие токены лучше предсказывают гибридные модели?
- Исследование способности LLM решать задачи по статике
- Stripe, Anthropic и OpenAI финансируют борьбу с респираторными инфекциями
- Совместное открытие знаковых квантовых алгоритмов: от интуиции к теореме
- Малые правки, большие модели: как редактирование Википедии формирует ценности языковых моделей
- AgentOdyssey: открытые текстовые игры с длинным горизонтом для непрерывного обучения агентов на тест-тайме
- Витамин D не так бесполезен, как кажется скептикам
- Уровни Super Mario оказались неразрешимыми в теории вычислимости
- Notes2Skills: Из лабораторных заметок, умелые научные агенты
- NatureBench: могут ли ИИ-агенты повторить результаты лучших статей Nature?
- Использование LLM для оценки желаемости продукта по отзывам пользователей
- DiffusionBench: целостная оценка генеративных диффузионных трансформеров
- Автоматизированный поиск архитектур Mixture-of-Experts: 4463 кандидата за 28 дней
- Управление языком в LLM: почему прилагательные работают по-разному на разных моделях
- TAPO: учимся на собственных ошибках, новый метод дистилляции для LLM через микро-размышления
- KaLM-Reranker-V1: быстрый переранжировщик для сжатых документов без позднего взаимодействия
- HydraHead: гибридизация внимания на уровне голов трансформера
- EnterpriseClawBench: бенчмарк для агентов на реальных сессиях из офисной работы
- CORE: сжатие промптов без лишних моделей для edge-девайсов
- CLI-Universe: проверяемый движок синтеза задач для терминальных агентов
- Beyond LoRA: есть ли жизнь после самой популярной техники файн-тюнинга
- AI-SDLC: язык спецификаций для границ между людьми и агентами
- The Download: дебаты об узких местах ИИ и испытания нейроинтерфейсов
- PerceptionDLM: параллельное восприятие регионов в мультимодальных диффузионных моделях
- От пикселей к планам: ИИ для восстановления природы
- Логарифмы везде: как логи скрывают единицы и геометрию
- Как написать интерпретатор Lisp на Python за несколько сотен строк
- Как ИИ помогает людям разбираться в кожных заболеваниях
- DRL: награды для flow matching без человеческой разметки
- DF3DV-1K: датасет для синтеза новых видов без помех
- Медленное дыхание влияет на мозговую активность и склонность к рискам
- Критика геометрической алгебры: революция без результата
- Оставляй след: почему комментарии разработчиков имеют значение
- MIT создали микроскоп для чипов: ОС Fractal нашла уязвимости в Apple M1
- Курс по компиляторам Cornell: бесплатный продвинутый курс для самостоятельного прохождения
- Дзен в мире ИИ-исследований: как стать учёным
- Почему программы улучшений проваливаются: ловушка работать усерднее вместо работать умнее
- Claude Fable 5 показал средние результаты в тесте на безопасный код от Endor Labs