Случайно услышал на просторах интернета, что у Сбера, оказывается, есть открытая модель, которая по бенчмаркам русского языка бьёт Whisper, проверил, и понял, что она не просто не хуже, она работает мгновенно да еще и на обычном процессоре, без GPU, а текст появляется быстрее, чем успеваешь отпустить кнопку

Дальше понеслось, собрал диктовку для себя, раздал друзьям, всем понравилось, начали пользоваться, и разумеется, повалились хотелки, а давай сделаем это, а пусть оно ещё вот так, из этого за пару недель вырос целый продукт.

Что получилось и как работает:

Держишь правый ⌘ command, говоришь, отпускаешь, текст с пунктуацией и заглавными уже вставлен туда, где стоял курсор.

Замеры дали такие параметры: фраза на 6 сек вставляется за 0.08 сек, запись 30 сек транскрибируется меньше чем за полсекунды, а загрузка модели поднимается за 0,22 сек.

Все локально звук не покидает комп, сама модель весит 204 МБ, а приложение 32 мб и работает на процессоре, видеокарту не используем, код открыт, лицензия MIT, с названием мудрить не стал, раз пишет под диктовку, пусть будет Писарь

Почему Писарь, а не Whisper

Whisper прекрасная модель, но универсальная, под сотню языков, и русский не в приоритете, к тому же она тяжёлая, на процессоре работает медленно, поэтому обёртки гонят её на видюху, мак греется, комп притормаживает, а текст всё равно появляется с задержкой, качество русского, падежи, окончания и пунктуация у Whisper хромают.

GigaAM, на базе которого я собрал Писаря, обучена Сбером специально на русском, и на нём она заметно точнее, плюс расставляет пунктуацию и заглавные, английские вкрапления в русской речи (термины, названия) она тоже переваривает как надо.

Есть и ограничение, диктовать целиком по‑английски не выйдет, буквы будут латинские, а написание фонетическое, для полностью английской речи берите Whisper, мой инструмент про русскую диктовку.

Хотелки

Когда я раздал первую версию друзьям, реакция была одна «Ничего себе, как быстро», и сразу пошли хотелки. Первой стала волна у курсора, было непонятно, идет запись или нет, поэтому появилась плашка с эквалайзером

Потом запилил обновления по воздуху, чтобы не качать архив руками каждый раз, приложение научилось проверять свежую версию, скачивать её с гитхаба.

Дальше пошли запросы посерьезнее: я говорю с «ну» и «короче», «эээ», можно, чтобы она причесывала» Так в приложении появился Мозг, локальная нейронка, я так же взял сберовскую (6,5 гб) и как альтернативу еще добавил QWEN (2,5 гб).

Так родились команды над выделенным, во время диктовки можно в конце добавить «Писарь причеши/переведи/сократи», и ты получаешь уже обработанный текст, или альтернатива — когда ты выделяешь абзац, зажимаешь клавишу ⌘ command, говоришь команду и текст меняется прямо на месте. И все это без выхода в интернет.

Первый сторонний разработчик пришёл через несколько дней и с тех пор прислал три пул реквеста, в основном, это были косметические правки.

Так за две недели из утилиты для себя выросло приложение, которым пользуются люди, которых я даже не знаю.

Очень хотелось с вами поделится, уверен, что и вам Писарь зайдет, ну а если вы видите ссылку на гитхаб, значит, модераторы любезно пропустили мой первый пост в вашем уютном сообществе. Всем, кто прочитал спасибо, кто оставил коммент, низкий поклон:) 

gigapisar.github.io

Комментарии (20)


  1. netricks
    10.09.2026 16:20

    Да, gigaam хорош. И удивительным образом малоизвестен. Хотя работает быстрее и качественнее whisper-large


  1. optim2004
    10.09.2026 16:20

    отличный и приятно выглядящий проект


    1. ladapriora Автор
      10.09.2026 16:20

      Спасибо! Внешний вид во многом заслуга стороннего разработчика, он прислал три пул-реквеста и подтянул меню и плашку к системному виду


  1. Nick_Korobkin
    10.09.2026 16:20

    планируется реализация для windows?


    1. ARad
      10.09.2026 16:20

      Попробуйте handy https://handy.computer/ для локальных моделей. Мне там больше понравилась модель Нематрон. Она со стримингом, поэтому позволяет… Транскрибирует уже часть речи, пока вы до конца фразу не договорили. Получается быстро. По крайней мере быстрее чем гигачатовская модель и работает точнее когда у вас смесь русского и английского.

      А если локальные модели вам не критичны, для облачных моделей попробуйте Spokenly https://spokenly.app/


    1. Efrem3112
      10.09.2026 16:20

      Для Windows есть Handy, с этой же моделью.


    1. ladapriora Автор
      10.09.2026 16:20

      Да, на днях хочу заняться виндой


    1. ladapriora Автор
      10.09.2026 16:20

      Да хочу попробовать для винды запилить тоже


  1. ARad
    10.09.2026 16:20

    Мне как разработчику он не подошел. Я с ИИ моделями разговариваю на смеси русского и английского. А он вообще английские термины не понимает, и слова английские не понимает и так далее.

    Я сейчас использую Gemini 3.5 Transcribe. Вот эту заметку набираю голосом через него.


    1. ladapriora Автор
      10.09.2026 16:20

      Подскажите пример фразы, которая не распозналась? В моих тестах вкрапления латиницей проходят ровно например проверь pull request на GitHub или скинь link на Google Doc, ломается она, только когда английского становится много модель русская, и длинную английскую речь пишет латиницей, но фонетически Если у вас именно такой режим, то да, Писарь не подойдёт, я об этом честно написал в статье. Если же падают отдельные термины, хочу разобраться, пришлите примеры.


      1. ARad
        10.09.2026 16:20

        Я использовал Handy может там модели GigaAM v3 как то неверно работают. Сейчас перешел на Spokenly там сетевые модели можно выбирать, GigaAM там нет.


    1. UniInter
      10.09.2026 16:20

      Сейчас в Handy по быстрому протестировал три модельки GigaAM, Nemotron и Parakeet.

      Победила GigaAM. Русский на отлично, со знаками препинания и даже уместными кавычками. Самая быстрая. Английский не только понимает отдельные слова и вставляет в текст, но и полностью диктовку на английском правильно расшифровывает. Заметил, чтобы именно на английском печатала, надо с английским акцентом говорить, а не как Мутко.

      Остальные две русский понимают хорошо, чуть медленнее расшифровывают. Английский у всех вроде одинаковый.


      1. ladapriora Автор
        10.09.2026 16:20

        А на чём Handy крутили, CPU или GPU?


        1. UniInter
          10.09.2026 16:20

          Наверное на CPU. В настройках я не нашел, на чем крутить, да и CUDA у меня нет.
          Мне еще Handy понравилась, потому что инсталлятор разрешил портабельнвый вариант установить.


  1. boofer_obmena
    10.09.2026 16:20

    Сайт глянул — значит, вы на v3 e2e, пунктуация вшита в модель, красиво. Любопытно, какой из пяти вариантов взяли: e2e_rnnt? И как крутите его на CPU — чистый PyTorch или перегнали в ONNX? На rnnt-декодере разница бывает заметной.
    Ну и вопрос на перспективу: в июне Сбер выложил GigaAM Multilingual — посимвольный CTC на 70+ языков, русский там всё ещё топовый. Она бы, может, закрыла и английскую диктовку без всякого Whisper?


    1. netricks
      10.09.2026 16:20

      Multilingual, к сожалению, в пунктуацию не умеет. Впрочем, это можно решить прогоном через дополнительную небольшую нейроночку. Но, это дополнительное время.


  1. ladapriora Автор
    10.09.2026 16:20

    e2e_rnnt, да в ONNX, int8, через ONNX Runtime, торча в приложении нет, про разницу на декодере согласен, поэтому декодер написал свой, на Свифте 6 секунд речи разбираются за 0,08 с

    Multilingual пробовал на тех же записях, английский она выдаёт кириллицей. Большую multilingual не гонял, если она пишет латиницей, можно попробовать как опциюю Если у вас есть опыт с ней, поделитесь


    1. boofer_obmena
      10.09.2026 16:20

      Свой декодер на Swift при ONNX int8 — это уже движок, а не обёртка, красиво. 6 сек речи за 0.08 — это порядка 75× быстрее реального времени.

      По large_multilingual: руками не щупал, но по карточке ai-sage/GigaAM-Multilingual ответ, похоже, неутешительный — на английском и 600M-версия сильно хуже Whisper: FLEURS WER 9.4 против 3.9 у Whisper large v3, Common Voice 21.5 против 20.0. И токенизатор там посимвольный, общий на 70+ языков — если малая пишет английский кириллицей, large, скорее всего, тоже: это свойство тренировочных данных, а не алфавита (латиница в нём есть — узбекский же). Проверить можно за 10 минут вашими же записями, но чуда, боюсь, не будет.

      Так что ваш стек, кажется, и так оптимален: русский на e2e_rnnt, а английские вкрапления — отдавать «Мозгу» на постобработку. Одна инструкция «верни правильное написание терминов» — и «агайл» превращается в Agile.


  1. Vicollel
    10.09.2026 16:20

    Диаризация есть?


    1. antirek
      10.09.2026 16:20

      в gigaam нет диаризации, вот пример как можно делать диаризацию https://github.com/antirek/calls-pipeline