Vocal Slice нарезает аудио по выделенному тексту, офлайн через Whisper
На Hacker News (раздел Show HN) представили Vocal Slice, настольное приложение для Mac и Windows, которое режет аудиозаписи на клипы по тексту расшифровки, и всё это работает локально, без отправки звука в облако. Пользователь загружает файл (WAV, MP3, FLAC, M4A, AAC или OGG) любой длины, приложение транскрибирует его на устройстве моделью Whisper с точностью до отдельного слова. Дальше нужно выделить нужную фразу в тексте расшифровки, волновая форма звука сразу перескакивает на этот участок, границы можно точно подвинуть перетаскиванием маркеров. Экспортированные клипы автоматически называются по шаблону пользователя (например, {source}{index}{slug}), так что после сессии не нужно вручную переименовывать файлы. Нарезка WAV-файлов побайтовая и без потерь, на выходе оригинальный звук, а не его переконвертированная копия; остальные форматы при экспорте декодируются в 24-битный WAV. Уже нарезанный клип можно открыть заново и подвинуть границы без повторной транскрипции. Приложение поддерживает английский и мультиязычные модели Whisper (от испанского и немецкого до японского, арабского и хинди), использует ускорение через WebGPU (включая GPU, встроенный в каждый Mac на Apple Silicon) и автоматически переключается на процессор, если видеокарта не поддерживается. По утверждению разработчиков, звук никогда не покидает устройство пользователя, аккаунт для этого не нужен, это подаётся как аргумент для работы с ещё не вышедшими эпизодами, материалами под NDA или интервью, которые пообещали не раскрывать. Подписка стоит $29 в год, включает все функции и обновления и действует на трёх устройствах; для начала доступен семидневный пробный период без привязки карты. Для запуска нужны Windows 10/11 (64-бит) или macOS 11 Big Sur и новее, любая GPU с поддержкой WebGPU (или запасной вариант на CPU), около 200 МБ на само приложение и ещё 75, 500 МБ на модель транскрипции; интернет нужен один раз, скачать модель и активировать лицензию, для самой транскрипции сеть не требуется. Сборка для Windows пока не подписана сертификатом, поэтому при первом запуске Windows SmartScreen предупреждает о «неизвестном издателе», предупреждение нужно пропустить вручную (More info → Run anyway).
Ключевые факты
- Vocal Slice транскрибирует аудио локальным Whisper и позволяет резать клипы, просто выделяя фразу в тексте расшифровки
- Вся обработка идёт на устройстве: звук не отправляется в облако, аккаунт не нужен
- Нарезка WAV, побайтовая, без потерь; остальные форматы при экспорте декодируются в 24-битный WAV
- Подписка $29 в год на три устройства, семидневный пробный период без карты
- Работает на Windows 10/11 и macOS 11+ через WebGPU с откатом на CPU; сборка для Windows пока без цифровой подписи
Почему это важно
Это нишевой, но точный пример продукта под конкретную боль: монтажёры и подкастеры часто ищут короткие фразы в многочасовых записях, а облачная транскрипция для конфиденциального аудио (интервью под NDA, неопубликованные эпизоды) не подходит. Vocal Slice убирает этот компромисс, вся расшифровка и нарезка идут на устройстве пользователя, без передачи звука куда-либо.
Кому это важно
Подкастерам, видеомонтажёрам, войсовер-артистам и другим создателям контента, которые вручную перебирают часы записей ради нескольких нужных фрагментов, а также всем, кто работает с материалом, который нельзя выгружать в облако.
Как это применить
Загружаете запись (WAV, MP3, FLAC, M4A, AAC или OGG), Whisper транскрибирует её локально до уровня отдельных слов, вы выделяете нужную фразу, приложение находит и вырезает соответствующий участок звука, границы можно подправить перетаскиванием. Экспорт идёт по собственному шаблону именования файлов; WAV режется без потерь, другие форматы конвертируются в 24-битный WAV. Стоимость, $29 в год за все функции на трёх устройствах, сначала доступна семидневная пробная версия без карты. Нужны Windows 10/11 или macOS 11+, GPU с поддержкой WebGPU (либо CPU как запасной вариант), около 200 МБ под приложение и 75, 500 МБ под модель распознавания.
Можно ли доверять
Всё, что известно о продукте, взято из его собственного описания на сайте, независимой проверки утверждений о работе исключительно на устройстве в источнике нет. Пост на Hacker News набрал скромный отклик (7 очков, 3 комментария на момент публикации), сведений о разработчике или команде за продуктом в тексте не приводится.
Риски и подводные камни
Заявление «звук никогда не покидает устройство» проверить со стороны нечем, это слова самого производителя, а не результат независимого аудита. Сборка для Windows пока не имеет цифровой подписи, из-за чего SmartScreen показывает предупреждение о неизвестном издателе при первом запуске. Данных о скорости или точности распознавания, а также сравнения с другими инструментами транскрипции и монтажа в источнике нет. Модель монетизации, подписочная: если она не продлена, транскрипция и экспорт приостанавливаются (файлы и настройки при этом сохраняются).
«Ваш звук никогда не покидает устройство.»
— Vocal Slice (описание продукта)