Apple выпустила LensVLM-9B, модель, сжимающую текст в изображения

Apple выложила на Hugging Face карточку модели LensVLM-9B, визуально-языковую модель (VLM) на 9 миллиардов параметров. Модель сканирует сжатые в изображения страницы текста и с помощью обучаемых инструментов избирательно разворачивает в исходный, несжатый вид только те страницы, которые релевантны запросу, остальные остаются в сжатом виде. Это предлагается как способ работать с длинным контекстом эффективнее, чем при обработке всего текста целиком.
Модель построена на модифицированной Apple версии модели Qwen. К релизу прилагаются статья «LensVLM: Selective Context Expansion for Compressed Visual Representation of Text» (препринт arXiv:2605.07019, авторы, Рой Ся, Дэн Фридман, Донхан Ю, Бовен Пань, Кристофер Фифти, Чан-Хён Ким, Сяньчжи Ду, Чже Гань, Вивек Ратход и Бхуван Дингра) и код на GitHub. Файлы модели, включая доработки Qwen, распространяются по Apple Machine Learning Research Model License, а исходный код, отдельно, по Apple Sample Code License.
Запустить модель можно через Transformers, vLLM, SGLang или Docker; в карточке приведены примеры команд, в том числе демо-скрипт с флагом степени сжатия. Доступны три предустановленные степени сжатия текста: 5x, 10x и 15x. За последний месяц модель скачали 233 раза. В самой карточке модели не приводятся ни бенчмарки, ни сравнения с другими VLM или обычными моделями с длинным контекстом, ни дата релиза модели, указан лишь 2026 год как год публикации статьи.
Ключевые факты
- LensVLM-9B, визуально-языковая модель Apple на 9 млрд параметров, опубликована на Hugging Face
- Построена на модифицированной Apple версии модели Qwen
- Сканирует сжатые в изображения страницы текста и разворачивает через обучаемые инструменты только релевантные страницы
- Доступны степени сжатия текста 5x, 10x и 15x
- Есть сопроводительная статья (arXiv:2605.07019) и код на GitHub; на модель и код действуют разные лицензии Apple
Почему это важно
Длинный контекст остаётся дорогой задачей для языковых и визуально-языковых моделей: чем больше текста нужно держать в памяти и обрабатывать, тем выше затраты. LensVLM предлагает нестандартный обходной путь, представить текст как изображения страниц и обрабатывать их выборочно, разворачивая в полный вид только те части, что действительно нужны для ответа, вместо того чтобы прогонять через модель весь объём сразу.
Кому это важно
В первую очередь исследователям и инженерам, работающим с обработкой длинных документов, системами поиска по большим корпусам текста и визуально-языковыми моделями, им карточка модели даёт готовый чекпойнт, статью с описанием метода и код для экспериментов.
Как это применить
Модель доступна на Hugging Face и запускается через библиотеку Transformers, а также через инференс-серверы vLLM и SGLang, включая Docker-образы. В карточке приведены готовые примеры команд, в том числе демонстрационный скрипт, принимающий текстовый файл, вопрос и параметр степени сжатия (5x, 10x или 15x). Полный код и инструкции по подготовке данных и оценке лежат в отдельном репозитории на GitHub. При этом файлы модели распространяются по Apple Machine Learning Research Model License, а сопровождающий код, по отдельной Apple Sample Code License, что стоит учитывать перед использованием.
Можно ли доверять
Карточка модели опубликована на официальной странице Apple на Hugging Face и сопровождается статьёй и открытым кодом, что позволяет независимо проверить метод. Однако сама карточка не содержит бенчмарков, оценок точности или сравнений с другими моделями, эффективность подхода на основании этого текста оценить нельзя, нужно смотреть саму статью.
Риски и подводные камни
В карточке модели нет опубликованных числовых результатов, метрик качества или сравнений с текстовыми моделями с длинным контекстом, эффективно ли решение на практике, по этому источнику судить нельзя. Отдельно стоит учитывать лицензионные ограничения: модель распространяется по исследовательской лицензии Apple, а код, по отдельной лицензии для примеров кода, что может ограничивать коммерческое использование.