Случайно услышал на просторах интернета, что у Сбера, оказывается, есть открытая модель, которая по бенчмаркам русского языка бьёт Whisper, проверил, и понял, что она не просто не хуже, она работает мгновенно да еще и на обычном процессоре, без GPU, а текст появляется быстрее, чем успеваешь отпустить кнопку
Дальше понеслось, собрал диктовку для себя, раздал друзьям, всем понравилось, начали пользоваться, и разумеется, повалились хотелки, а давай сделаем это, а пусть оно ещё вот так, из этого за пару недель вырос целый продукт.
Что получилось и как работает:
Держишь правый ⌘ command, говоришь, отпускаешь, текст с пунктуацией и заглавными уже вставлен туда, где стоял курсор.
Замеры дали такие параметры: фраза на 6 сек вставляется за 0.08 сек, запись 30 сек транскрибируется меньше чем за полсекунды, а загрузка модели поднимается за 0,22 сек.
Все локально звук не покидает комп, сама модель весит 204 МБ, а приложение 32 мб и работает на процессоре, видеокарту не используем, код открыт, лицензия MIT, с названием мудрить не стал, раз пишет под диктовку, пусть будет Писарь
Почему Писарь, а не Whisper
Whisper прекрасная модель, но универсальная, под сотню языков, и русский не в приоритете, к тому же она тяжёлая, на процессоре работает медленно, поэтому обёртки гонят её на видюху, мак греется, комп притормаживает, а текст всё равно появляется с задержкой, качество русского, падежи, окончания и пунктуация у Whisper хромают.
GigaAM, на базе которого я собрал Писаря, обучена Сбером специально на русском, и на нём она заметно точнее, плюс расставляет пунктуацию и заглавные, английские вкрапления в русской речи (термины, названия) она тоже переваривает как надо.
Есть и ограничение, диктовать целиком по‑английски не выйдет, буквы будут латинские, а написание фонетическое, для полностью английской речи берите Whisper, мой инструмент про русскую диктовку.
Хотелки
Когда я раздал первую версию друзьям, реакция была одна «Ничего себе, как быстро», и сразу пошли хотелки. Первой стала волна у курсора, было непонятно, идет запись или нет, поэтому появилась плашка с эквалайзером
Потом запилил обновления по воздуху, чтобы не качать архив руками каждый раз, приложение научилось проверять свежую версию, скачивать её с гитхаба.
Дальше пошли запросы посерьезнее: я говорю с «ну» и «короче», «эээ», можно, чтобы она причесывала» Так в приложении появился Мозг, локальная нейронка, я так же взял сберовскую (6,5 гб) и как альтернативу еще добавил QWEN (2,5 гб).
Так родились команды над выделенным, во время диктовки можно в конце добавить «Писарь причеши/переведи/сократи», и ты получаешь уже обработанный текст, или альтернатива — когда ты выделяешь абзац, зажимаешь клавишу ⌘ command, говоришь команду и текст меняется прямо на месте. И все это без выхода в интернет.
Первый сторонний разработчик пришёл через несколько дней и с тех пор прислал три пул реквеста, в основном, это были косметические правки.
Так за две недели из утилиты для себя выросло приложение, которым пользуются люди, которых я даже не знаю.
Очень хотелось с вами поделится, уверен, что и вам Писарь зайдет, ну а если вы видите ссылку на гитхаб, значит, модераторы любезно пропустили мой первый пост в вашем уютном сообществе. Всем, кто прочитал спасибо, кто оставил коммент, низкий поклон:)
Комментарии (20)

optim2004
10.09.2026 16:20отличный и приятно выглядящий проект

ladapriora Автор
10.09.2026 16:20Спасибо! Внешний вид во многом заслуга стороннего разработчика, он прислал три пул-реквеста и подтянул меню и плашку к системному виду

Nick_Korobkin
10.09.2026 16:20планируется реализация для windows?

ARad
10.09.2026 16:20Попробуйте handy https://handy.computer/ для локальных моделей. Мне там больше понравилась модель Нематрон. Она со стримингом, поэтому позволяет… Транскрибирует уже часть речи, пока вы до конца фразу не договорили. Получается быстро. По крайней мере быстрее чем гигачатовская модель и работает точнее когда у вас смесь русского и английского.
А если локальные модели вам не критичны, для облачных моделей попробуйте Spokenly https://spokenly.app/

ARad
10.09.2026 16:20Мне как разработчику он не подошел. Я с ИИ моделями разговариваю на смеси русского и английского. А он вообще английские термины не понимает, и слова английские не понимает и так далее.
Я сейчас использую Gemini 3.5 Transcribe. Вот эту заметку набираю голосом через него.

ladapriora Автор
10.09.2026 16:20Подскажите пример фразы, которая не распозналась? В моих тестах вкрапления латиницей проходят ровно например проверь pull request на GitHub или скинь link на Google Doc, ломается она, только когда английского становится много модель русская, и длинную английскую речь пишет латиницей, но фонетически Если у вас именно такой режим, то да, Писарь не подойдёт, я об этом честно написал в статье. Если же падают отдельные термины, хочу разобраться, пришлите примеры.

ARad
10.09.2026 16:20Я использовал Handy может там модели GigaAM v3 как то неверно работают. Сейчас перешел на Spokenly там сетевые модели можно выбирать, GigaAM там нет.

UniInter
10.09.2026 16:20Сейчас в Handy по быстрому протестировал три модельки GigaAM, Nemotron и Parakeet.
Победила GigaAM. Русский на отлично, со знаками препинания и даже уместными кавычками. Самая быстрая. Английский не только понимает отдельные слова и вставляет в текст, но и полностью диктовку на английском правильно расшифровывает. Заметил, чтобы именно на английском печатала, надо с английским акцентом говорить, а не как Мутко.
Остальные две русский понимают хорошо, чуть медленнее расшифровывают. Английский у всех вроде одинаковый.

ladapriora Автор
10.09.2026 16:20А на чём Handy крутили, CPU или GPU?

UniInter
10.09.2026 16:20Наверное на CPU. В настройках я не нашел, на чем крутить, да и CUDA у меня нет.
Мне еще Handy понравилась, потому что инсталлятор разрешил портабельнвый вариант установить.

boofer_obmena
10.09.2026 16:20Сайт глянул — значит, вы на v3 e2e, пунктуация вшита в модель, красиво. Любопытно, какой из пяти вариантов взяли: e2e_rnnt? И как крутите его на CPU — чистый PyTorch или перегнали в ONNX? На rnnt-декодере разница бывает заметной.
Ну и вопрос на перспективу: в июне Сбер выложил GigaAM Multilingual — посимвольный CTC на 70+ языков, русский там всё ещё топовый. Она бы, может, закрыла и английскую диктовку без всякого Whisper?
netricks
10.09.2026 16:20Multilingual, к сожалению, в пунктуацию не умеет. Впрочем, это можно решить прогоном через дополнительную небольшую нейроночку. Но, это дополнительное время.

ladapriora Автор
10.09.2026 16:20e2e_rnnt, да в ONNX, int8, через ONNX Runtime, торча в приложении нет, про разницу на декодере согласен, поэтому декодер написал свой, на Свифте 6 секунд речи разбираются за 0,08 с
Multilingual пробовал на тех же записях, английский она выдаёт кириллицей. Большую multilingual не гонял, если она пишет латиницей, можно попробовать как опциюю Если у вас есть опыт с ней, поделитесь

boofer_obmena
10.09.2026 16:20Свой декодер на Swift при ONNX int8 — это уже движок, а не обёртка, красиво. 6 сек речи за 0.08 — это порядка 75× быстрее реального времени.
По large_multilingual: руками не щупал, но по карточке ai-sage/GigaAM-Multilingual ответ, похоже, неутешительный — на английском и 600M-версия сильно хуже Whisper: FLEURS WER 9.4 против 3.9 у Whisper large v3, Common Voice 21.5 против 20.0. И токенизатор там посимвольный, общий на 70+ языков — если малая пишет английский кириллицей, large, скорее всего, тоже: это свойство тренировочных данных, а не алфавита (латиница в нём есть — узбекский же). Проверить можно за 10 минут вашими же записями, но чуда, боюсь, не будет.
Так что ваш стек, кажется, и так оптимален: русский на e2e_rnnt, а английские вкрапления — отдавать «Мозгу» на постобработку. Одна инструкция «верни правильное написание терминов» — и «агайл» превращается в Agile.

Vicollel
10.09.2026 16:20Диаризация есть?

antirek
10.09.2026 16:20в gigaam нет диаризации, вот пример как можно делать диаризацию https://github.com/antirek/calls-pipeline
netricks
Да, gigaam хорош. И удивительным образом малоизвестен. Хотя работает быстрее и качественнее whisper-large