Whisper
Whisper от OpenAI – это открытая нейросетевая модель для автоматического распознавания речи, которая позволяет превращать аудио‑ и видеозаписи в структурированный текст без необходимости платить за подписку или подключаться к внешним сервисам. Благодаря публичному коду и готовым моделям любой пользователь может запустить Whisper на своём компьютере, выбрать подходящий размер модели и получить транскрипцию с высокой точностью, поддержкой более 90 языков и возможностью прямого перевода на английский.
Как Whisper работает и почему он стал популярным
Whisper построен на архитектуре трансформера и обучен на более чем 600 000 часов разнообразного аудиоматериала, включая речь с различными акцентами, фоновыми шумами и технической терминологией. Модель умеет одновременно определять язык utterance, удалять шум и расставлять знаки препинания. Благодаря модульной структуре пользователь может выбрать одну из нескольких предустановленных версий модели, отличающихся размером, скоростью работы и требуемыми аппаратными ресурсами.
Ключевые особенности модели
- Автоматическое определение языка и подавление фонового шума.
- Поддержка более 90 языков, включая русский, с автоматической разметкой пунктуации.
- Возможность выполнения перевода распознанной речи непосредственно на английский в рамках одного прохода.
- Публичный исходный код под лицензией MIT, позволяющий модифицировать модель под специфические задачи.
- Отсутствие обязательных платежей и подписок – всё работает офлайн после локальной установки.
Выбор размера модели
Whisper предлагает несколько вариантов: tiny, base, small, medium и large (включая large‑v2). Чем больше модель, тем выше потенциальная точность, но тем больше требуется оперативной памяти и, как правило, графического процессора. Tiny и base подходят для быстрой работы на CPU, small – компромисс между скоростью и качеством, medium и large обеспечивают лучшую точность при наличии GPU с минимум 6‑8 ГБ видеопамяти. Выбор зависит от объёма обрабатываемого аудио, требуемой точности и доступных аппаратных ресурсов.
Установка Whisper локально
Windows 10/11
- Установка Python – скачайте последнюю стабильную версию 3.11+ с сайта python.org. Во время установки отметьте опцию «Add Python to PATH».
- Открыть терминал – нажмите Win+S, введите cmd и запустите.
- Установить Whisper – выполните команду pip install -U openai-whisper. Если pip не распознаётся, используйте python -m pip install -U openai-whisper.
- Установить FFmpeg – эта библиотека нужна для чтения различных аудио‑ и видеоформатов. Можно установить через pip install ffmpeg-python или скачать собранный бинарник с официального репозитория GitHub, распаковать и добавить путь к папке bin в переменную среды PATH.
- Проверить установку – в терминале наберите whisper --help. Должен появиться список доступных аргументов и описание использования.
Linux (Ubuntu/Debian)
- Обновите пакеты: sudo apt update && sudo apt upgrade -y.
- Установите Python и pip: sudo apt install python3 python3-pip -y.
- Убедитесь, что версия Python 3.11 или выше: python3 --version.
- Установите Whisper: pip3 install -U openai-whisper.
- Установите FFmpeg: sudo apt install ffmpeg -y.
- Проверьте: whisper --help.
macOS
- Установите Homebrew, если ещё не установлен: /bin/bash -c "$(curl -fsSL raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)".
- Установите Python 3.11+: brew install python@3.11 и добавьте путь к бинарникам в PATH согласно выводу brew.
- Установите pip: он уже входит в установку Python.
- Установите Whisper: pip3 install -U openai-whisper.
- Установите FFmpeg: brew install ffmpeg.
- Проверьте: whisper --help.
Практическое использование
Транскрипция аудиофайла
Для простой расшифровки файла interview.mp3 моделью small на русском языке выполните: whisper interview.mp3 --model small --language ru. Результат появится в текущей директории в виде файлов interview.txt, interview.srt и interview.vtt.
Перевод во время транскрипции
Если нужен сразу английский перевод, добавьте флаг --translate en: whisper lecture.m4a --model medium --language ru --translate en. На выходе получите файл lecture.en.txt с переводом.
Пакетная обработка
Для обработки всей папки с аудиозаписями можно воспользоваться простым циклом в оболочке: for f in *.wav; do whisper "$f" --model small --language ru; done. Каждый файл будет обработан отдельно, а результаты сохранены рядом с исходником.
Интеграция через Python
Whisper можно вызвать из собственного скрипта, используя пакет whisper. Загрузите модель, например small, передайте путь к аудиофайлу и укажите язык. Полученный словарь содержит ключ text с распознанным содержимым, который можно дальше обрабатывать, сохранять в базу данных или добавлять метаданные.
Преимущества и ограничения
| Преимущества | Ограничения |
|---|---|
| Бесплатный, без подписок и скрытых платежей | Для моделей medium и large рекомендуется GPU; иначе работа на CPU может быть медленной |
| Полностью офлайн после установки – данные не покидают ваш компьютер | Установка через терминал может показаться непонятной новичкам |
| Поддержка более 90 языков и автоматический перевод на английский | Перевод доступен только на один целевой язык за раз (по умолчанию английский) |
| Гибкий выбор размера модели – от быстрого tiny до точного large | Отсутствует графический интерфейс; управление осуществляется через командную строку или API |
| Открытый код под лицензией MIT – можно адаптировать под специфические задачи | Некоторые редкие диалекты или сильно искажённый speech могут распознаваться хуже |
Важные условия использования
- Модель распространяется под лицензией MIT, что допускает коммерческое использование, модификацию и распространение при сохранении указания авторства.
- Для работы с аудио‑файлами необходим FFmpeg; без него Whisper не сможет прочитать многие форматы.
- При использовании больших моделей рекомендуется иметь как минимум 6 ГБ видеопамяти; иначе возможны ошибки из‑за нехватки ресурсов.
- Whisper не требует подключения к интернет после установки, но при первом запуске может потребоваться загрузка весов модели (примерно от 150 МБ до 1,5 ГБ в зависимости от размера).
- Выходные файлы содержат чистый текст; если нужна разметка говорящих или временные метки, их необходимо добавлять отдельно (например, через инструменты диаризации).
Часто задаваемые вопросы (FAQ)
Поддерживает ли Whisper русский язык?
Да, Whisper распознаёт русский язык на уровне, сравнимом с другими主要 языками. При указании параметра --language ru модель выполняет транскрипцию с учётом фонетики и грамматики русского.
Нужен ли интернет для работы после установки?
Нет. После того как веса модели скачаны и сохранены в кэше (~/.cache/whisper), все операции выполняются полностью офлайн.
Какие форматы файлов поддерживаются?
Whisper полагается на FFmpeg для чтения аудио, поэтому поддерживает все форматы, которые FFmpeg умеет декодировать: MP3, WAV, M4A, FLAC, AAC, OGG, WebM и многие другие. При необходимости происходит автоматическое конвертирование во внутренний формат.
Можно ли использовать Whisper в Docker?
Да. Официальный репозиторий предоставляет Dockerfile, либо можно собрать собственный образ на базе python:3.11-slim, установив зависимости pip install openai-whisper ffmpeg. Затем контейнер можно запустить, монтируя локальную папку с аудио в /data и указывая путь к файлу.
Как ускорить работу на CPU, если нет GPU?
Выберите меньшую модель (tiny или base), которая оптимизирована для CPU. Также можно включить использование инструкций AVX2 через переменную окружения OMP_NUM_THREADS, задав количество ядер, например: OMP_NUM_THREADS=4 whisper file.mp3 --model tiny. Это позволит лучше задействовать многоядерные процессоры.
Практические советы
- Перед запуском длительной транскрипции проверьте свободное место на диске: каждый час аудио в формате WAV может занять около 600 МБ, а промежуточные файлы модели требуют дополнительное место.
- Для получения субтитров в формате SRT укажите параметр --output_format srt (по умолчанию генерируются txt, srt и vtt).
- Если нужно только текст без временных меток, добавьте --output_format txt.
- При работе с несколькими языками в одном файле (например, код‑свитч) текущая версия Whisper не поддерживает автоматическое переключение языков внутри одного аудиосегмента; рекомендуется предварительно разбить запись на одноязычные фрагменты.
- Для улучшения качества в шумных условиях можно предварительно обработать аудио шумоподавлением (например, через ffmpeg -i input.wav -af «afftdn» denoised.wav) и затем подать на вход Whisper.
- Сохраняйте исходные аудиофайлы в неизменном виде; при необходимости вы сможете повторно запустить транскрипцию с другими параметрами модели без потери исходного материала.
Заключение
Whisper представляет собой мощный и гибкий инструмент для преобразования речи в текст, который подходит как для одиночных пользователей, так и для команд в образовании, медиа, юриспруденции и доступности. Благодаря открытому коду, отсутствию лицензионных платежей и возможности выбора размера модели каждый может настроить workflow под свои задачи и аппаратные возможности. При соблюдении простых условий установки и учёта ограничений аппаратных ресурсов Whisper обеспечивает надёжную, конфиденциальную и экономичную расшифровку аудио‑ и видеоконтента.
Информация обновлена — 18.08.2026.