Apple выпустила LensVLM-9B, модель, сжимающую текст в изображения

Apple выпустила LensVLM-9B, модель, сжимающую текст в изображения

Apple выложила на Hugging Face карточку модели LensVLM-9B, визуально-языковую модель (VLM) на 9 миллиардов параметров. Модель сканирует сжатые в изображения страницы текста и с помощью обучаемых инструментов избирательно разворачивает в исходный, несжатый вид только те страницы, которые релевантны запросу, остальные остаются в сжатом виде. Это предлагается как способ работать с длинным контекстом эффективнее, чем при обработке всего текста целиком.

Модель построена на модифицированной Apple версии модели Qwen. К релизу прилагаются статья «LensVLM: Selective Context Expansion for Compressed Visual Representation of Text» (препринт arXiv:2605.07019, авторы, Рой Ся, Дэн Фридман, Донхан Ю, Бовен Пань, Кристофер Фифти, Чан-Хён Ким, Сяньчжи Ду, Чже Гань, Вивек Ратход и Бхуван Дингра) и код на GitHub. Файлы модели, включая доработки Qwen, распространяются по Apple Machine Learning Research Model License, а исходный код, отдельно, по Apple Sample Code License.

Запустить модель можно через Transformers, vLLM, SGLang или Docker; в карточке приведены примеры команд, в том числе демо-скрипт с флагом степени сжатия. Доступны три предустановленные степени сжатия текста: 5x, 10x и 15x. За последний месяц модель скачали 233 раза. В самой карточке модели не приводятся ни бенчмарки, ни сравнения с другими VLM или обычными моделями с длинным контекстом, ни дата релиза модели, указан лишь 2026 год как год публикации статьи.

Ключевые факты

  • LensVLM-9B, визуально-языковая модель Apple на 9 млрд параметров, опубликована на Hugging Face
  • Построена на модифицированной Apple версии модели Qwen
  • Сканирует сжатые в изображения страницы текста и разворачивает через обучаемые инструменты только релевантные страницы
  • Доступны степени сжатия текста 5x, 10x и 15x
  • Есть сопроводительная статья (arXiv:2605.07019) и код на GitHub; на модель и код действуют разные лицензии Apple

Почему это важно

Длинный контекст остаётся дорогой задачей для языковых и визуально-языковых моделей: чем больше текста нужно держать в памяти и обрабатывать, тем выше затраты. LensVLM предлагает нестандартный обходной путь, представить текст как изображения страниц и обрабатывать их выборочно, разворачивая в полный вид только те части, что действительно нужны для ответа, вместо того чтобы прогонять через модель весь объём сразу.

Кому это важно

В первую очередь исследователям и инженерам, работающим с обработкой длинных документов, системами поиска по большим корпусам текста и визуально-языковыми моделями, им карточка модели даёт готовый чекпойнт, статью с описанием метода и код для экспериментов.

Как это применить

Модель доступна на Hugging Face и запускается через библиотеку Transformers, а также через инференс-серверы vLLM и SGLang, включая Docker-образы. В карточке приведены готовые примеры команд, в том числе демонстрационный скрипт, принимающий текстовый файл, вопрос и параметр степени сжатия (5x, 10x или 15x). Полный код и инструкции по подготовке данных и оценке лежат в отдельном репозитории на GitHub. При этом файлы модели распространяются по Apple Machine Learning Research Model License, а сопровождающий код, по отдельной Apple Sample Code License, что стоит учитывать перед использованием.

Можно ли доверять

Карточка модели опубликована на официальной странице Apple на Hugging Face и сопровождается статьёй и открытым кодом, что позволяет независимо проверить метод. Однако сама карточка не содержит бенчмарков, оценок точности или сравнений с другими моделями, эффективность подхода на основании этого текста оценить нельзя, нужно смотреть саму статью.

Риски и подводные камни

В карточке модели нет опубликованных числовых результатов, метрик качества или сравнений с текстовыми моделями с длинным контекстом, эффективно ли решение на практике, по этому источнику судить нельзя. Отдельно стоит учитывать лицензионные ограничения: модель распространяется по исследовательской лицензии Apple, а код, по отдельной лицензии для примеров кода, что может ограничивать коммерческое использование.