Vals привлекла $40 млн в раунде Series A на бенчмарки для ИИ

Vals привлекла $40 млн в раунде Series A на бенчмарки для ИИ

Vals, стартап, основанный в 2024 году 25-летним Раяном Кришнаном, который хочет заменить устаревшую систему бенчмарков для ИИ-моделей. Кришнан стажировался в Palantir и, учась в Стэнфорде, работал в Microsoft и в стэнфордской лаборатории искусственного интеллекта; по его словам, Vals родилась из наблюдения, что академические бенчмарки не поспевают за темпом появления новых мощных моделей.

Год назад Vals привлекла посевной раунд под руководством 8VC и Bloomberg Beta, а в прошлом месяце, после периода быстрого роста, закрыла раунд Series A на $40 млн, который возглавила Andreessen Horowitz. Точная дата закрытия раунда и оценка компании не раскрываются.

Отличие Vals от многих других систем бенчмаркинга в том, что она не публикует свои тестовые материалы, по мнению Кришнана, публичные тесты позволяют компаниям обучать модели специально под них, то есть фактически списывать на экзамене. Вместо проверки общих знаний (вроде вопросов в духе экзамена на адвоката) Vals оценивает, способны ли модели выполнять сложные задачи в конкретных индустриях, праве, финансах, разработке ПО, на уровне человека, а также анализирует, к каким негативным последствиям могут привести ошибки моделей. Список направлений расширяется: у компании уже есть бенчмарк на рекурсивное самоулучшение моделей, идёт работа над оценками в области ментального здоровья, кибербезопасности, биобезопасности и способности моделей применять Женевскую конвенцию в вопросах законов вооружённого конфликта.

Бизнес-модель Vals, компании платят за тестирование собственных моделей; Кришнан сравнивает это с тем, как школьник платит совету колледжей за сдачу SAT. По его словам, выручка компании сейчас в восемь раз выше, чем год назад. Штат вырос с восьми человек в начале года до 25, и компания планирует нанять ещё 10, 15 человек и переехать в офис большего размера. Vals также недавно запустила программу по оценке моделей для федеральных агентств США, какие именно агентства участвуют, не уточняется.

Кришнан видит в независимой оценке моделей будущую основу того, как ИИ-компании будут отчитываться перед рынком: он ссылается на то, что SpaceX уже стала публичной компанией, Anthropic должна выйти на биржу позже в этом году, а OpenAI, по его ожиданиям, тоже станет публичной в обозримом будущем, и в этом контексте бенчмарки, по его мнению, станут частью того, как компании готовят публичную отчётность и рассказывают о планируемых инвестициях в ИИ.

Ключевые факты

  • Vals привлекла $40 млн в раунде Series A, который возглавила Andreessen Horowitz, через год после посевного раунда от 8VC и Bloomberg Beta.
  • Компанию в 2024 году основал 25-летний Раян Кришнан, ранее стажировавшийся в Palantir и работавший в Microsoft и лаборатории ИИ Стэнфорда.
  • Vals не раскрывает свои тестовые задания публично и оценивает модели на прикладных задачах в праве, финансах и разработке ПО, а не на абстрактных экзаменационных тестах.
  • Выручка компании выросла в восемь раз год к году, штат, с 8 до 25 человек; в планах нанять ещё 10, 15 человек и переехать в офис побольше.
  • Vals запустила программу оценки моделей для федеральных агентств США и расширяет тесты на рекурсивное самоулучшение, ментальное здоровье, кибербезопасность, биобезопасность и Женевскую конвенцию.

Почему это важно

Старые публичные бенчмарки легко «выучить наизусть»: модель можно дообучить именно под опубликованные тестовые вопросы, и высокий результат перестаёт что-либо доказывать. Vals предлагает закрытые, привязанные к реальным рабочим задачам тесты, это часть более широкого сдвига индустрии от абстрактных экзаменов к проверке того, может ли модель реально заменить человека в конкретной профессии.

Кому это важно

Прежде всего, компаниям, которые выбирают, какую модель встроить в свои продукты: независимая непубличная оценка снижает риск купить модель, «нарисовавшую» хорошие цифры на знакомых тестах. Также это важно инвесторам и самим ИИ-компаниям вроде OpenAI и Anthropic, которым, по словам основателя Vals, скоро придётся объяснять рынку качество своих моделей в публичной отчётности.

Как это применить

Модель работы Vals, компании сами платят за тестирование своих моделей, чтобы понять их слабые места и улучшить продукт; Кришнан сравнивает это с оплатой экзамена SAT. Такой формат подходит компаниям, которым нужна независимая проверка перед выводом модели на рынок или перед закупкой чужой модели для внутренних процессов.

Можно ли доверять

Материал написан журналистом TechCrunch по итогам личного визита в офис Vals и интервью с сооснователем; цифры раунда и роста выручки/штата, из первых уст компании и её инвесторов, без независимого подтверждения оценки компании или точной даты закрытия сделки. Стоит держать в уме, что почти все содержательные оценки в тексте, это самоописание компании, а не независимая проверка.

Риски и подводные камни

Есть конфликт интересов: компании сами платят Vals за оценку своих же моделей, а непубличность тестов не позволяет сторонним экспертам проверить их качество и непредвзятость. Претензия на роль «золотого стандарта» в одной частной компании означает, что рынок может стать зависимым от чужой закрытой методологии. Расширение тестов на такие чувствительные области, как биобезопасность и применение Женевской конвенции, повышает цену возможных ошибок в самой методике оценки.

«Мы видели, как на рынок быстро выходит множество новых, очень способных моделей, а академические бенчмарки не поспевали за этим передовым рывком»

— Раян Кришнан, сооснователь Vals