Личный архив Циолковского хранится в Архиве РАН под номером фонда 555. В нём 2 019 дел и 51 008 отсканированных листов. Сканы много лет лежат в открытом доступе, но пользоваться ими почти невозможно. Нет ни каталога, по которому можно искать, ни расшифровок, ни набора данных.

Этим летом я расшифровал фонд целиком и выложил открыто. Данные опубликованы под CC0 с постоянным DOI 10.5281/zenodo.21705221, код под MIT лежит на github.com/beskvladimir‑create/tsiolkovsky‑papers, поиск по всему фонду работает на beskvladimir‑create.github.io/tsiolkovsky‑papers, метод описан в препринте arXiv:2608.03617.
Сама расшифровка оказалась самой простой частью. Настоящая задача была в другом. Как измерить точность машинного чтения рукописи, если сверять не с чем? Та же задача каждый день встаёт в продакшн‑системах на LLM. Система выдаёт тысячи ответов, и объём как раз та причина, по которой проверить их некому.
Почему «оцифровано» не значит «доступно»
Портал архива отдаёт сканы, но собрать из них датасет без приключений не получится.
Идентификатор в адресе страницы не совпадает с архивным номером дела. Например, id=300 указывает на дело 297 первой описи. Сдвиг накапливается из‑за дел с буквенными номерами вроде 145а или 585а, всего таких дел 31. В сквозной нумерации они позицию занимают, а в архивной нет. Каталог, собранный по очевидному прочтению URL, ссылался бы не на те дела.
Номер описи в адресе вообще ни на что не влияет. Страницы 1_actview.aspx?id=834 и 5_actview.aspx?id=834 возвращают один и тот же документ. Настоящий архивный адрес удалось вытащить только из путей к файлам сканов.
Крупные сканы, тяжелее примерно 800 КБ, сервер отдаёт обрезанными до 130 КБ. Целиком их получилось забрать только range‑запросами. Браузер при этом молча сохраняет обрубок и не показывает никакой ошибки.
Здесь нет претензии к архиву. Он сделал главное, отсканировал и выложил 51 008 листов. Просто между картинками в интернете и фондом, по которому можно спрашивать, лежит заметное расстояние.

Измерение без эталона
Чтобы измерить точность распознавания, нужен эталон, то есть тот же текст, набранный человеком. У архивного фонда эталона нет. Был бы эталон, не понадобилось бы и машинное чтение. Оценки через внутреннюю уверенность модели не работают, потому что складная выдумка удовлетворяет им не хуже правильного прочтения.
Выход подсказали сами документы. Личные фонды эпохи пишущей машинки часто хранят один и тот же текст дважды. Авторская рукопись и машинописная копия с неё лежат в одном деле. Я читаю оба варианта одним конвейером и сравниваю результаты. Текст один, конвейер один, единственная переменная это читаемость страницы. Значит, расхождение двух прочтений измеряет трудность рукописи.
В фонде нашлось 1 759 таких пар в 224 делах. Медианное согласие двух прочтений составило 37% слов. Медиана самого длинного дословно совпавшего куска равна 10 словам, и в 43% пар длиннее ничего нет. Вот что на самом деле означает фраза «машинно прочитанная рукопись начала XX века».
Сам приём тоже нуждается в проверке. Она возможна там, где настоящий эталон всё‑таки есть, потому что у части дел текст сохранился в печатных изданиях. На этих делах парная оценка оказалась несмещённой в пределах процентного пункта. Ранжирует страницы по трудности она так же, как истина. Ранговая корреляция составила 0,67 по всем 55 парам, 0,92 на 32 парах, где издание доказуемо содержит тот же текст, и 0,97 на 17 самых надёжных.
Прямое сравнение с изданиями даёт 98,1% знаков на машинописи и 81,1% на рукописи. По словам получается 91,7% и 73,7%.
Правило переносится на любой продакшн. Эталона на всё не бывает почти никогда, но на что‑то он есть почти всегда. Этим малым куском калибруется прокси‑метрика, дальше она масштабируется.
Отрицательные результаты
Расскажу про три находки, которых не бывает в вендорских презентациях. Каждая сначала выглядела результатом.
Сравнение авторских редакций оказалось невозможным. В фонде лежит «Космический корабль» в двух авторских вариантах, идеальный материал для текстологии. Ради таких сравнений всё отчасти и затевалось. Варианты совпали между собой на 19% слов. Это меньше, чем совпадают два машинных прочтения одной и той же страницы. Ниже шумового порога различие версий неотличимо от ошибки чтения. Я закрыл эту линию работы и вшил запрет в инструмент. Программа отказывается показывать различия, не прошедшие порог.
Классификатор прошёл тест и всё равно ошибается. Рукопись от машинописи я отделял по разбросу длин чернильных штрихов. На размеченной вручную выборке классификатор дал 19 из 19. Потом на 4 675 листах нашёлся независимый сигнал для проверки, и точность на них составила 80%. Копии под копирку и выцветшая машинопись читаются как рукопись. Маленький чистый тест‑сет сертифицирует демо, а не систему.
Дефект модели притворился данными. На 236 листах модель зациклилась и повторяла одну строку разметки до 635 раз подряд. Каждый повтор считался пометкой неуверенности и завысил опубликованную статистику на 6 189. Ни одна статистическая проверка этого не поймала, потому что 236 листов из 51 008 не сдвигают никакое распределение. Поймал человек, который открыл файл глазами.
Разница между измерением и впечатлением в том, что измерение позволяет узнать о собственной неправоте. А публичное признание ошибок делает выжившие цифры заслуживающими доверия.
Бюджет на «размышление» и другие грабли
У новых моделей по умолчанию включено размышление, и оно тратит тот же бюджет вывода, что и ответ. При лимите 4 096 токенов до 3 929 уходило на размышление. Расшифровка обрывалась на середине листа, и обрубок был неотличим от плохого чтения. Я выставил минимальный уровень размышления. Качество не упало, объём вывода сократился вдвое. Если ваш конвейер оценивает выходы модели, тихое усечение выше по потоку замаскируется под проблему качества ниже по потоку.
Ещё два листа не читает ни одна модель. Немецкая машинописная рецензия 1927 года срабатывает на встроенный фильтр против дословного воспроизведения известного печатного текста. Эти листы прочитаны отдельным способом и помечены в корпусе.
Выбор модели замером, а не по прайс‑листу
Кандидатов я сравнивал на одних и тех же листах против машинописной копии того же текста, взяв прежний конвейер как базовую линию. На типичном почерке ни одна модель заметно не превзошла остальные. На выборке из 48 листов более дорогая модель была лучше на 37 листах и хуже на 11. Выигрыш есть, но цену на этом материале он не окупает, потому что потолок задаёт материал.
Дешёвая адекватная модель прочитала остаток фонда, все 41 212 листов, пакетным режимом за одну ночь. Стоимость прогона составила величину порядка десятков долларов. Узкое место таких задач давно не бюджет, а измерение качества.
Вывод для рабочих задач простой. Бенчмаркайте на своём материале и с базовой линией до выбора ценового тира.
Что получилось
Корпус нужно воспринимать как инструмент поиска, а не как научное издание. Машиной прочитано всё, человеком не выверено ничего, у каждого дела стоит ссылка на скан архива. Неуверенные чтения помечены пословно. Авторские зачёркивания размечены, их набралось 36 446. Дореформенная орфография сохранена как есть. Публикуются только целиком расшифрованные дела, потому что частичная расшифровка читается как связный текст с молча пропущенной серединой.
Датировка 1 969 дел впервые позволяет посмотреть на фонд по времени. 86% дел приходится на последние восемнадцать лет жизни Циолковского. При этом тридцатые годы дают 58% дел, но лишь 40% листов. Работа в поздние годы не прекращается, она укорачивается.
Все 39 скриптов открыты, каждое число из этой статьи пересчитывается одной командой. Отдельный скрипт сверяет двадцать величин статьи с текущими данными и ругается на расхождения. Появился он после того, как аннотация разошлась с основным текстом на один процент.
Проект независимый, к Архиву РАН отношения не имеет и им не одобрен.
Об авторе: Владимир Бескоровайный, архитектор энтерпрайз‑систем с ИИ, независимый исследователь. ORCID 0009–0004-7005-6242.
linux-over
интересно, что современные философы сознания совсем не упоминают панпсихизм от Циолковского и его монизм, хотя называют 100500 более поздних трудов
vladimirbesk Автор
Да, философии в фонде много, и она наименее разобрана. Про дирижабли и ракеты давно издано, а этот пласт почти никто не открывал. Лежит в основном в описи 1, там же, где остальные его собственные работы. Причём один и тот же текст он переписывал по нескольку раз и под разными названиями, я нашёл 376 таких пар дел. Так что вопрос «сколько у него текстов про монизм» по описи не решается, надо смотреть в сам текст, а он теперь машинно прочитан, процентов 80 знаков по рукописи, для поиска хватает, а для цитаты открывать скан.