Handy

Handy Проверено
Handy

Обзор Handy

Handy — бесплатный открытый диктофон для десктопа, который вставляет распознанную речь в любое текстовое поле системы одним нажатием клавиши. Проект создал CJ Pais после травмы руки, лишившей его возможности печатать, и позиционирует его как гибкий каркас для голосового ввода, а не как закрытый коммерческий продукт. К 11 сентября 2026 года репозиторий на GitHub набрал более 27 200 звёзд и 2 400 форков, последний стабильный релиз v0.9.4 вышел 21 июля 2026 года, лицензия — MIT.

Как работает Handy

Пользователь назначает горячую клавишу (или включает режим push‑to‑talk). При зажатии начинается запись с микрофона, при отпускании аудиофрагмент проходит через локальную модель распознавания, а готовый текст вставляется туда, где стоит курсор — в браузер, IDE, мессенджер, терминал или любое другое поле ввода. Весь конвейер выполняется на устройстве, голос не покидает компьютер.

Основные компоненты конвейера

  • Silero VAD — фильтр активности голоса, удаляет тишину и микропаузы до отправки на распознавание, чтобы фразы не склеивались в бессвязный блок.
  • Модель ASR — выбирается из каталога (Whisper, Parakeet, GigaAM, Nemotron, Voxtral, Qwen3‑ASR, Cohere Transcribe, Canary и др.). Модели скачиваются по требованию и кэшируются локально.
  • Постобработка — автоматическая пунктуация, нормализация чисел и сокращений (зависит от модели), пользовательский словарь, опция «добавить пробел» между фразами.
  • Вставка текста — два режима: через буфер обмена с эмуляцией Ctrl+V (по умолчанию) и «прямой» ввод, имитирующий нажатия клавиш, для приложений, где буфер обмена работает нестабильно.

История записей

Каждая фраза попадает во вкладку «История» со встроенным плеером: можно прослушать оригинал, скопировать текст или открыть папку с аудиофайлами. Глубина истории настраивается — автоудаление через 3 дня, 2 недели или 3 месяца, а также лимит количества записей.

Дополнительные настройки аудио

  • Выбор микрофона — ручной пик в настройках, если автоматический выбор даёт плохое качество.
  • Приглушение системного звука — опция «отключить звук во время записи» временно снижает громкость других источников (музыка, видео) и восстанавливает её после диктовки.
  • Порог VAD (0.1–0.9) — в шумном офисе повышают, чтобы отсекать фоновые голоса; в тихой комнате понижают, чтобы не терять тихие начала фраз.

Каталог моделей распознавания

Модель не зашита в бинарник — выбирается в настройках из пополняемого списка. На лето 2026 года доступны следующие семейства:

СемействоВариантыОсобенности
WhisperSmall, Medium, Turbo, LargeМногоязычные, сильные на английском, требуют больше ОЗУ и времени загрузки
ParakeetUnified EN, TDT 0.6B v3Быстрые стриминговые модели от NVIDIA, хорошие для английского
Nemotron Streaming 3.5Стриминговая модель NVIDIA, ориентирована на низкую задержку
Voxtral Mini 4BКомпактная многоязычная модель от Mistral
Qwen3‑ASR0.6B, 1.7BМногоязычные модели от Alibaba, баланс скорости и качества
Cohere TranscribeМногоязычная модель от Cohere
Canary 180M FlashОчень лёгкая модель для слабого железа
GigaAMv3 E2E‑RNN‑T, E2E‑CTC, «чистые» RNN‑T/CTCСпециализированные на русском (700 000 ч обучения), ставят пунктуацию и нормализуют числа

Для каждой модели в интерфейсе показаны: WER на тестовых наборах, real‑time factor (скорость), список языков, размер на диске (150–200 МБ до нескольких ГБ). Метка «многоязычная» включает русский, метка «перевод на английский» означает, что модель сразу выдаёт перевод. Большие модели дольше загружаются в ОЗУ при первом запуске; компактные (GigaAM, Canary, Parakeet Small) стартуют за секунды.

GigaAM — рекомендуемый старт для русского

При первом запуске Handy не устанавливает модель по умолчанию, а показывает список из ~15 вариантов. Для русскоязычных пользователей разработчик рекомендует GigaAM v3 E2E‑RNN‑T — линейку от Сбера, обученной на 700 000 часов русской речи. Она уже расставляет знаки препинания, приводит числа и сокращения к читаемому виду без дополнительной постобработки.

По внутреннему бенчмарку Сбера (LLM‑судья на 500 случайных примерах по разным доменам) GigaAM v3 E2E‑RNN‑T обходит Whisper‑large‑v3 со счётом 70 к 30 по точности. Это собственный тест разработчика модели, но методология описана.

В семействе также есть:

  • E2E‑CTC — чуть быстрее, точность незначительно ниже;
  • «Чистые» RNN‑T и CTC — без пунктуации и нормализации, для разработчиков, которым нужен сырой транскрипт под свою постобработку.

Ограничение: GigaAM понимает только русский. В текстах со смешанными англоязычными терминами (Claude, OpenAI, GitHub, MCP, названия фреймворков) приходится вручную переключаться на многоязычную модель — Whisper Large, Parakeet TDT 0.6B v3 или Qwen3‑ASR.

Платформы, установка и системные требования

Handy собран на Tauri: UI — React + TypeScript, системный слой и аудио — Rust. Официальные дистрибутивы:

  • macOS — Intel и Apple Silicon (DMG, Homebrew: brew install --cask handy);
  • Windows — x64 и ARM (MSI, winget: winget install handy);
  • Linux — x64 и ARM (AppImage, .deb, .rpm, Snap, Flatpak, AUR для Arch).

Пакеты Homebrew и winget собирают независимые мейнтейнеры. Для Linux на Wayland корректная вставка текста требует наличия wtype или ydotool в системе (устанавливаются через пакетный менеджер дистрибутива).

Минимальные аппаратные требования (ориентировочно)

  • CPU: x64 / ARM64 с поддержкой AVX2 (для ускорения Whisper) — желательно, но не обязательно;
  • RAM: 4 ГБ для компактных моделей (GigaAM, Parakeet Small, Canary), 8–16 ГБ для Whisper Large / Qwen3‑ASR 1.7B;
  • Диск: 1–10 ГБ под кэш моделей;
  • GPU: опционально, ускоряет Whisper через CoreML (macOS), CUDA/DirectML (Windows), Vulkan (Linux) — настраивается в config.json вручную, в UI пока нет переключателя.

CLI и автоматизация

Для работы из скриптов и привязки к собственным горячим клавишам оконного менеджера предусмотрены флаги:

  • handy --toggle-transcription — переключить состояние диктовки (старт/стоп);
  • handy --start-hidden — запуск без отображения окна;
  • handy --no-tray — запуск без иконки в системном трее.

Команды управляют уже запущенным экземпляром (single-instance). Типичный сценарий автозапуска: добавить в автозагрузку ОС handy --start-hidden --no-tray — приложение будет ждать горячей клавиши в фоне.

Приватность, лицензия и монетизация

Распознавание полностью локальное — аудио и текст никогда не уходят в сеть. Исходный код открыт под MIT, можно форкать, дорабатывать, встраивать в свои продукты. Платных тарифов, подписок и лимитов по времени использования нет. Проект поддерживается спонсорами (Wordcab, Epicenter, Bolt AI) и добровольными донатами через Stripe, GitHub Sponsors, PayPal, Buy Me a Coffee, Ko‑fi — донаты не разблокируют функции, они просто помогают оплачивать инфраструктуру и время мейнтейнеров.

Кому и зачем нужен Handy

  • Люди с временными или постоянными ограничениями рук: травмы, RSI, туннельный синдром, артрит.
  • Разработчики, диктующие промпты для агентных инструментов (Claude Code, Cursor, Aider, Copilot Chat) — голос быстрее клавиатуры на длинных естественно‑языковых запросах.
  • Журналисты, копирайтеры, блогеры — быстрые черновики, интервью, лиды прямо в CMS или Google Docs.
  • Студенты и преподаватели — конспектирование лекций, создание субтитров к записям занятий.
  • Пользователи, не доверяющие облачным STT (Yandex SpeechKit, Google, Azure, Whisper API) — медицинские, юридические, коммерческие тайны остаются на диске.
  • Энтузиасты приватности и открытого ПО — полный контроль над данными и кодом.

Преимущества и ограничения

Плюсы

  • Полная офлайн‑работа, голос не покидает устройство.
  • Бесплатно, без подписок, лицензия MIT.
  • Специализированная русская модель GigaAM с автопунктуацией и нормализацией.
  • Интерфейс локализован на русский (отдельно от языка распознавания).
  • Широкий выбор моделей под разные задачи и железо.
  • Активная разработка: регулярные релизы, публичный трекер багов на GitHub.
  • CLI для автоматизации и интеграции с оконными менеджерами.
  • Кроссплатформенность: macOS, Windows, Linux (включая ARM).

Минусы и известные проблемы

  • При первом запуске нет модели «по умолчанию» — нужно выбрать из ~15 вариантов вручную.
  • Whisper‑модели на некоторых конфигурациях Windows и Linux падают при загрузке/инференсе — баг подтверждён разработчиками, фикса в v0.9.4 нет.
  • На Linux с Wayland для вставки текста обязательны wtype или ydotool (не входят в дистрибутив).
  • GigaAM только русский — для смешанных RU/EN текстов нужен ручной переключатель модели.
  • Нет GUI‑переключателя GPU‑ускорения (только через config.json).
  • Проект позиционируется как «каркас», а не готовое коммерческое решение — SLA и гарантий поддержки нет.

Практические советы и сценарии

Выбор модели под задачу

  • Русский + пунктуация «из коробки» — GigaAM v3 E2E‑RNN‑T.
  • Смешанные RU/EN тексты — Whisper Large / Turbo, Parakeet TDT 0.6B v3, Qwen3‑ASR 1.7B.
  • Слабое железо / нужна скорость — GigaAM E2E‑CTC, Parakeet Small, Canary 180M Flash.
  • Сырой транскрипт для своей постобработки — «чистые» GigaAM RNN‑T / CTC.
  • Эксперименты с переводом на английский — модели с меткой «перевод на английский» (Whisper, некоторые Qwen).

Настройка шумоподавления (VAD)

В «Настройки → VAD» ползунок 0.1–0.9. Шумный офис/кафе — 0.6–0.8. Тихая комната — 0.2–0.4. Если начало фразы обрезается — снижайте; если ловится фоновый разговор — повышайте.

Пользовательский словарь

Меню «Словарь» → добавить термины: названия внутренних проектов, аббревиатуры, ники коллег, специфические технические термины (например, «RAG», «Kubernetes», «WebAssembly»). После добавления модель чаще выдаёт правильное написание, минимизируя ручную правку.

Интеграция с автозапуском

Добавьте в автозагрузку ОС: handy --start-hidden --no-tray. Приложение поднимется в фоне, горячая клавиша (по умолчанию Ctrl+Space, меняется в настройках) будет работать сразу после входа в систему.

Примеры реальных сценариев

  1. Разработчик пишет промпт для Claude Code: зажимает Ctrl+Space, диктует «объясни разницу между синхронным и асинхронным кодом в Python с примерами», отпускает — готовый текст вставляется в чат IDE.
  2. Журналист готовит заметку для CMS: включает push‑to‑talk, говорит заголовок и лид, текст появляется в редакторе сайта без копипаста.
  3. Студент конспектирует лекцию по ML: диктует «трансформер‑based архитектура с multi‑head attention», пользовательский словарь гарантирует правильное написание терминов.
  4. Врач заполняет анамнез: работает офлайн, голос пациента и диагнозы не уходят в облако, соответствует требованиям к защите медданных.
  5. Автор кода документирует функцию: диктует docstring на русском, переключает модель на Whisper для английских названий параметров, возвращается на GigaAM.

Сообщество, поддержка и развитие

Разработчик ведёт публичный список известных проблем в Issues на GitHub и призывает сообщество участвовать в исправлении. Есть Discord‑сервер (ссылка в README репозитория) для быстрых вопросов, обсуждения моделей и обмена конфигами. Документация на handy.computer/docs покрывает установку, настройку моделей, CLI, troubleshooting для Wayland и GPU‑ускорения. Контрибьюторы присылают PR для новых моделей, переводов UI, исправлений багов вставки на Linux.

Где скачать и как начать

Официальный сайт: handy.computer — там прямые ссылки на DMG, MSI, AppImage, .deb, .rpm, а также инструкции для Homebrew, winget, Snap, Flatpak, AUR. После установки:

  1. Запустите Handy — откроется окно выбора модели.
  2. Для русского выберите GigaAM v3 E2E‑RNN‑T (скачается ~500 МБ).
  3. Назначьте удобную горячую клавишу в настройках (по умолчанию Ctrl+Space).
  4. Проверьте микрофон и при необходимости выберите его вручную.
  5. При работе на Linux Wayland установите wtype или ydotool.

Заключение

Handy — зрелый, бесплатный и полностью локальный инструмент голосового ввода, который закрывает нишу между облачными сервисами (дорогие, требуют интернет, собирают данные) и встроенными системными диктофонами (ограниченные языки, слабая пунктуация, нет выбора моделей). Благодаря открытой архитектуре, широкому каталогу моделей — включая специализированную русскую GigaAM — и активному сообществу, проект подходит как для временной замены клавиатуры при травмах, так и для постоянного повышения продуктивности разработчиков, авторов и всех, кто ценит приватность и контроль над своим голосом.

Информация обновлена — 11.09.2026.

106
Нет отзывов. Ваш будет первым!