TechCrunch выпустил словарь терминов ИИ, от LLM до «непрозрачной рекурсии» в модели OpenAI Astra

TechCrunch ведёт живой, регулярно обновляемый словарь терминов ИИ, объяснение простым языком тех слов, которые звучат на любой презентации или питче: LLM, RAG, RLHF и так далее. Поводом для очередного обновления стало то, что на прошлой неделе в обиход вошёл термин «непрозрачная рекурсия» (opaque recurrence), так называют технику рассуждений в новой модели OpenAI Astra, которая, по словам издания, встревожила исследователей безопасности ИИ. Что именно означает эта техника технически и кто конкретно из исследователей обеспокоен, в тексте не раскрывается, термин упомянут как повод для статьи, а не как отдельная словарная статья.
Далее издание разбирает по алфавиту базовые понятия. AGI (искусственный общий интеллект) определяется по-разному: CEO OpenAI Сэм Альтман называл его «эквивалентом среднего человека, которого можно нанять как коллегу», устав OpenAI, «высокоавтономными системами, превосходящими людей в большинстве экономически ценных видов работы», а Google DeepMind понимает AGI как «ИИ, как минимум не уступающий человеку в большинстве когнитивных задач», то есть единого определения в индустрии нет.
Среди других терминов: ИИ-агент, инструмент, самостоятельно выполняющий цепочки задач (бронирование, подача расходов, написание кода) в отличие от простого чат-бота; API-эндпоинты, «кнопки» внутри ПО, которые могут нажимать другие программы или агенты; цепочка рассуждений (chain of thought), разбивка задачи на промежуточные шаги для более точного ответа, характерная для reasoning-моделей; кодинг-агенты, специализированные агенты, которые сами пишут, тестируют и правят код с минимальным контролем человека; compute, вычислительные мощности (GPU, CPU, TPU), на которых работает вся индустрия ИИ.
Также объясняются: глубокое обучение, обучение через многослойные нейросети, требующее больших объёмов данных и более долгого и дорогого обучения по сравнению с простыми моделями; диффузия, техника генерации изображений, музыки и текста через постепенное «зашумление» данных и обучение обратному процессу восстановления; дистилляция, перенос знаний от большой модели-«учителя» к меньшей модели-«ученику»; по данным статьи, именно так, вероятно, был создан GPT-4 Turbo, ускоренная версия GPT-4, а дистилляция чужой модели обычно нарушает условия использования API и чат-ассистентов конкурентов, хотя саму технику внутри своих продуктов используют все ИИ-компании; файнтюнинг, дообучение модели на узкоспециализированных данных под конкретную задачу; GAN (генеративно-состязательная сеть), пара нейросетей, где одна генерирует данные, а другая пытается отличить их от настоящих, что хорошо работает для узких задач вроде реалистичных фото и видео, но не для универсального ИИ; галлюцинация, генерация ИИ неверной информации, которую издание связывает с пробелами в обучающих данных и считает одной из причин тренда на узкоспециализированные, вертикальные модели; инференс, сам процесс запуска обученной модели для предсказаний, который возможен только после обучения и который по-разному быстро выполняется на разном железе, от смартфонов до серверных ИИ-чипов; LLM, большие языковые модели вроде тех, что стоят за ChatGPT, Claude, Gemini, Llama и Mistral, обученные на миллиардах книг, статей и текстов; кэш памяти, в частности KV-кэш, техника, ускоряющая инференс за счёт сохранения части вычислений для повторного использования. Последним в сохранённом фрагменте текста идёт Model Context Protocol (MCP), открытый стандарт подключения ИИ-моделей к внешним инструментам и данным; изложение статьи обрывается на середине этой статьи словаря, и что издание пишет про MCP и термины после него, из доступного текста не видно.
Ключевые факты
- TechCrunch ведёт постоянно обновляемый словарь терминов ИИ и обновил его из-за термина «непрозрачная рекурсия», техники рассуждений в новой модели OpenAI Astra, которая, по словам издания, встревожила исследователей безопасности; что техника означает технически, в тексте не раскрыто
- Единого определения AGI в индустрии нет: у Сэма Альтмана (OpenAI), «эквивалент среднего человека-коллеги», у устава OpenAI, «системы автономнее человека в большинстве экономически ценной работы», у Google DeepMind, «ИИ не хуже человека в большинстве когнитивных задач»
- Словарь разбирает базовые понятия: ИИ-агент, API-эндпоинты, цепочка рассуждений, кодинг-агенты, compute, глубокое обучение, диффузия, дистилляция, файнтюнинг, GAN, галлюцинация, инференс, LLM, кэш памяти
- По данным статьи, дистилляция, вероятная технология создания GPT-4 Turbo из GPT-4; дистилляция чужой модели обычно нарушает условия использования API конкурентов, хотя саму технику внутри своих продуктов применяют все ИИ-компании
- Сохранённый фрагмент текста статьи обрывается на середине разбора Model Context Protocol (MCP), дальнейшие термины словаря в исходном материале недоступны
Почему это важно
Индустрия ИИ производит новый жаргон быстрее, чем большинство людей, включая специалистов из смежных областей, успевает его усвоить: LLM, RAG, RLHF и теперь «непрозрачная рекурсия» звучат на любой презентации или питче как нечто самоочевидное. TechCrunch фиксирует эту особенность прямым текстом и держит справочник именно как живой документ, который обновляется вслед за языком отрасли, а не как разовую публикацию.
Кому это важно
Материал адресован тем, кто работает с ИИ-продуктами, инвестирует в них или просто пытается разбираться в новостях и подкастах на эту тему, не обладая техническим бэкграундом, то есть широкой аудитории вокруг индустрии, а не только инженерам.
Как это применить
Словарь можно использовать как справочник при чтении технических новостей: он раскладывает по полочкам термины вроде диффузии, дистилляции, файнтюнинга, GAN или кэша памяти простым языком и без лишнего технического жаргона, показывая, чем одно понятие отличается от смежного (например, ИИ-агент от кодинг-агента, или инференс от обучения).
Можно ли доверять
Определения опираются на прямые цитаты первоисточников, устав OpenAI, слова Сэма Альтмана, позицию Google DeepMind, а не на пересказ издания от себя, что повышает достоверность базовой части словаря. Слабое место, открывающий статью тезис про «непрозрачную рекурсию»: издание называет модель (OpenAI Astra) и эффект (обеспокоенность исследователей безопасности), но не приводит ни техническое объяснение самой техники, ни имена или цитаты конкретных исследователей, проверить это утверждение по доступному тексту нечем.
Риски и подводные камни
Сама статья честно признаёт, что единого определения AGI в индустрии не существует, три цитируемых источника дают три разных формулировки, и это стоит держать в уме при чтении любых громких заявлений о «достижении AGI». Также стоит учитывать, что доступный фрагмент текста обрывается на середине статьи о Model Context Protocol, поэтому часть словаря, вероятно, более новые или менее устоявшиеся термины, в этом пересказе не отражена.
«Эквивалент среднего человека, которого можно нанять как коллегу.»
— Сэм Альтман, CEO OpenAI, про определение AGI