Ты пишешь вопрос и нажимаешь Enter. Через секунду начинают появляться слова. Кажется, будто кто-то думает и печатает. Но внутри не происходит ничего похожего на мышление — зато происходит кое-что куда более странное и интересное.


Главное заблуждение

Большинство людей представляют языковую модель как умную базу данных: спросил — она нашла ответ и выдала. Это не так.

LLM — это машина, которая предсказывает следующий токен. Всё. Из этой одной простой задачи, повторённой миллиарды раз на триллионах слов текста, вырастает нечто, которое умеет объяснять квантовую физику, писать код и иногда убедительно врать.

Давай разберёмся, как именно.


Шаг 1. Твой текст перестаёт быть текстом

Первое, что происходит с твоим сообщением — оно разбивается на токены.

Токен — это не слово и не буква. Это статистически удобная единица текста. Слово «кот» — скорее всего один токен. Слово «непроизносимый» — несколько. Редкое имя из трёх букв может оказаться двумя токенами, а частый суффикс «-tion» в английском — одним.

Токенизация строится на частотности. Алгоритм BPE (Byte Pair Encoding) смотрит на огромный корпус текста и объединяет самые частые пары символов в один токен. Получается словарь из 50–100 тысяч токенов.

На практике это объясняет несколько странностей. Модели хуже работают с редкими языками — там каждое слово разбивается на много мелких кусков и контекстное окно «съедается» быстрее. Задачи на подсчёт букв вызывают затруднения именно потому, что модель видит не буквы, а токены, и внутри токена буквы не различаются. Именно поэтому «сколько букв R в слове strawberry?» — классический тест на провал.


Шаг 2. Числа вместо слов

После токенизации каждому токену сопоставляется вектор — список из нескольких тысяч чисел. Он называется эмбеддингом и кодирует смысл токена.

Представь карту города. Каждая точка описывается двумя числами — широтой и долготой. Близкие точки — близкие места. В пространстве эмбеддингов то же самое, только измерений не два, а несколько тысяч, и «близость» означает смысловую похожесть.

Слова «кошка» и «собака» окажутся рядом. «Король» минус «мужчина» плюс «женщина» даст вектор, близкий к «королеве» — знаменитый пример, показывающий что в числах закодированы реальные смысловые отношения.

Важно: эмбеддинги не прописываются вручную. Они получаются автоматически в процессе обучения. Модель сама «выясняет», что кошки и собаки похожи, просто читая текст.


Шаг 3. Сердце трансформера — механизм внимания

До трансформеров нейросети обрабатывали текст последовательно — слово за словом. Это создавало проблему: к концу длинного предложения начало уже «забывалось».

Трансформер решил это радикально: смотреть на все токены сразу и для каждого вычислять, насколько каждый другой токен важен прямо сейчас. Этот механизм называется self-attention.

Для каждого токена вычисляются три вектора: Query («что я ищу?»), Key («что я предлагаю?») и Value («что отдам, если меня выбрали?»). Токен сравнивает свой Query с Key каждого другого и получает веса — числа, показывающие, насколько каждый другой токен важен для него.

В предложении «Маша дала Кате книгу, которую та давно хотела» слово «та» должно понять, что относится к «Кате». Механизм внимания позволяет слову буквально «посмотреть» на все предыдущие токены и найти нужный.

Таких «голов» внимания в современных моделях несколько десятков. Каждая следит за своим: одна — за синтаксисом, другая — за кореференциями, третья — за тематическими связями. Всё параллельно.


Шаг 4. Слои — обработка идёт вглубь

Один блок self-attention — это ещё не вся модель. Трансформер состоит из множества таких блоков, уложенных стопкой. Даже скромные модели имеют их десятки.

Зачем столько? Потому что понимание текста — многоуровневая задача. Нижние слои улавливают поверхностные паттерны: части речи, грамматику. Средние работают с семантикой — кто что делает, какие сущности связаны. Верхние отвечают за что-то похожее на рассуждение — факты, логика, контекст всего разговора.

Каждый слой берёт представление токенов из предыдущего, обогащает его и передаёт дальше. К верхнему слою каждый токен уже «знает» о себе всё, что можно было извлечь из контекста.


Шаг 5. На выходе — не слово, а вероятности

Модель не выдаёт следующее слово. Она выдаёт распределение вероятностей по всему словарю — для каждого из 50–100 тысяч токенов вычисляется число: насколько вероятно, что именно он должен идти следующим.

«Москва — столица» → «России» 78%, «нашей» 9%, «бывшего» 3%... и так для всех токенов словаря.

Дальше происходит сэмплинг — выбор конкретного токена. Здесь появляются параметры из настроек API.

Temperature управляет «резкостью» распределения. При температуре близкой к нулю модель почти всегда выбирает самый вероятный токен — ответы предсказуемые и повторяющиеся. При высокой — вероятности выравниваются, модель чаще выбирает неожиданные токены. Отсюда и «творческий режим», и галлюцинации.

Top-p ограничивает выбор только токенами, суммарная вероятность которых не превышает p. При top-p = 0.9 модель рассматривает только «ядро» наиболее вероятных токенов и игнорирует весь длинный хвост маловероятных вариантов.


Шаг 6. Слово за словом — авторегрессия

Модель генерирует текст по одному токену за раз. После того как токен выбран, он добавляется к контексту, и вся процедура запускается заново для следующего токена.

Именно поэтому ответ появляется постепенно — это не анимация для красоты, это буквально то, как работает генерация.

Из этого вытекают важные следствия. Модель не может «передумать» посередине предложения. Если в начале написала «Я согласен» — весь дальнейший текст генерируется в контексте этого «согласен», даже если по логике нужно было написать обратное. Этим объясняется, почему модели иногда уверенно гонят чушь до конца абзаца.

И именно поэтому промпты «думай шаг за шагом» реально работают: они заставляют модель генерировать промежуточные токены-рассуждения, которые потом влияют на финальный ответ.


Откуда берутся знания

Всё описанное выше — это архитектура. Сама по себе она ничего не умеет. Смысл появляется в процессе обучения.

Задача простая: дай текст, скрой последнее слово, пусть модель угадает. Сравни с правильным ответом, посчитай ошибку, скорректируй веса. Повтори триллион раз.

Веса модели — это спрессованные знания. Числа, которых в крупных моделях более триллиона, кодируют всё прочитанное: факты, стили, логические паттерны, причинно-следственные связи. Всё это неявно закодировано в весах — не в виде базы данных, а в виде миллиардов слегка подкрученных чисел.


Попробуй сам почувствовать разницу

Читать про то, как модели рассуждают — одно. Наблюдать это в реальном времени — другое.

Попробуй этого телеграм-бота — внутри ChatGPT, Gemini, Grok и DeepSeek, бесплатно. Дай одинаковый запрос разным моделям и посмотри, как по-разному они выстраивают ответ. Например, спроси что-нибудь неоднозначное — «докажи, что 0.999... = 1» или «объясни парадокс Ферми». Разница в подходах хорошо показывает, что у каждой модели свой «характер» — сформированный архитектурой, данными и настройкой.


Пять фактов, которые реально удивляют

1. Модель не знает, что написала секунду назад

Между вызовами модель не хранит никакого состояния. «Память» ChatGPT — это просто очень длинный текстовый файл, который растёт с каждым сообщением и в какой-то момент упирается в лимит контекстного окна. Никакой «памяти» в человеческом смысле нет.

2. Длинный контекст — это дорого математически

Self-attention вычислительно стоит O(n²) от длины контекста. Удвоил длину — получил вчетверо больше вычислений. Именно поэтому окно в миллион токенов — инженерный подвиг, а не просто «добавили памяти».

3. Одинаковый запрос даёт разные ответы намеренно

Это не баг. Temperature > 0 означает, что каждый раз сэмплинг проходит чуть иначе. Если нужна воспроизводимость — явно ставь temperature = 0 и фиксируй seed.

4. Галлюцинации — обратная сторона интеллекта

Механизм, позволяющий модели обобщать знания и отвечать на вопросы, которых не было в обучающих данных — тот же самый, который заставляет её иногда уверенно придумывать несуществующие факты. Это не ошибка реализации, это цена за способность к обобщению.

5. Модель не понимает слова — она понимает паттерны

LLM никогда не видела реального кота. Она видела миллиарды предложений, в которых слово «кот» стояло рядом с «мурлыкает», «лапа», «хвост», «ветеринар». Всё её «знание» о кошках — это статистика соседства токенов. То, что это работает — само по себе удивительно.


Вместо заключения

LLM — не поисковик, не база данных и не цифровой человек. Это статистическая машина, обученная предсказывать текст на таком масштабе, что предсказание стало неотличимо от понимания — по крайней мере внешне.

Понимать устройство этой машины полезно не чтобы разрушить магию. А чтобы знать, где она работает идеально, где её легко сломать — и почему иногда она блестяще отвечает на вопрос, которого никто никогда не задавал.

Комментарии (10)


  1. gottivartanian
    06.06.2026 12:15

    Хорошо подмечено про «не может передумать посередине». Отсюда житейский лайфхак: не спорить с кривым ответом, а перегенерить с нуля, чуть переформулировав вопрос. Почти всегда лучше, чем десять уточнений вдогонку.


  1. grvelvet
    06.06.2026 12:15

    LLM — не поисковик, не база данных и не цифровой человек. Это статистическая машина, обученная предсказывать текст на таком масштабе, что предсказание стало неотличимо от понимания — по крайней мере внешне.

    И уж тем более не искуственный интеллект.


    1. iiibax
      06.06.2026 12:15

      LLM выполняет интеллектуальные задачи?


      1. grvelvet
        06.06.2026 12:15

        Вообще да. Но это не интеллект.


        1. iiibax
          06.06.2026 12:15

          т.е. жонглирующий робот != искуственный жонглёр?


          1. grvelvet
            06.06.2026 12:15

            Имитация. Это гигантская многомерная математическая функция и вероятностная модель языка, она отлично имитирует интеллект.


            1. iiibax
              06.06.2026 12:15

              имитирует интеллект на основе внешних сигналов, почти как человек

              это интеллект без человеческого носителя


              1. starfair
                06.06.2026 12:15

                На самом деле, думаю даже самые выдающие нейробиологи современности не дадут ответ на вопрос, а что на самом деле есть мышление у человека. Поэтому, может и не стоит так уж дистанцироваться от схожести статичтического предсказания у LLM и работой наших нейронных сетей в мозгах, которые несомненно более сложные, но не факт, что прямо принципиально иначе работающие.


  1. atomlib
    06.06.2026 12:15

    Попробуй этого телеграм-бота — внутри ChatGPT, Gemini, Grok и DeepSeek, бесплатно. Дай одинаковый запрос разным моделям и посмотри, как по-разному они выстраивают ответ. Например, спроси что-нибудь неоднозначное — «докажи, что 0.999... = 1» или «объясни парадокс Ферми». Разница в подходах хорошо показывает, что у каждой модели свой «характер» — сформированный архитектурой, данными и настройкой.

    Какая там может быть разница, если у вас внутри одна и та же глупенькая Llama, которая часто не может дописать ответ? В вашем боте этого ассортимента проприетарных моделей попросту нет.

    Вы уже третью сгенерированную статью с рекламой этого бота опубликовали. Зачем вы вводите людей в заблуждение? Кто-то ведь действительно может подумать, что современные флагманские большие языковые модели вот так отвечают.

    Зачем вы на Хабре публикуете писанину больших языковых моделей? Тут ведь абсолютно явно писала языковая модель, мне даже никакой детектор не нужен.

    Весь текст кишит «это не X, это Y» и прочими характерно разбитыми на два предложения противопоставлениями:

    Токен — это не слово и не буква. Это статистически удобная единица текста.

    Это не ошибка реализации, это цена за способность к обобщению.

    LLM — не поисковик, не база данных и не цифровой человек. Это статистическая машина

    Модель не выдаёт следующее слово. Она выдаёт распределение вероятностей

    Важно: эмбеддинги не прописываются вручную. Они получаются автоматически в процессе обучения

    Понимать устройство этой машины полезно не чтобы разрушить магию. А чтобы знать, где она работает идеально, где её легко сломать

    Ненужные кавычки, которые языковые модели так любят расставлять при малейшем оттенке переносного смысла:

    контекстное окно «съедается» быстрее

    Модель сама «выясняет», что кошки и собаки похожи

    Таких «голов» внимания в современных моделях несколько десятков.

    Temperature управляет «резкостью» распределения.

    Отсюда и «творческий режим», и галлюцинации.

    При top-p = 0.9 модель рассматривает только «ядро» наиболее вероятных токенов

    Модель не может «передумать»

    у каждой модели свой «характер»

    К верхнему слою каждый токен уже «знает» о себе всё, что можно было извлечь из контекста.

    Никакой «памяти» в человеческом смысле нет.

    Всё её «знание» о кошках — это статистика соседства токенов.

    Если начинать вчитываться, то в плане смысла всё максимально упрощено и опять же вводит в заблуждение. К примеру:

    Алгоритм BPE (Byte Pair Encoding) смотрит на огромный корпус текста и объединяет самые частые пары символов в один токен. Получается словарь из 50–100 тысяч токенов.

    А токенизатор o200k_base? В нём возможно 200 019 токенов. Это токенизатор GPT-4o, o1, o3, o4-mini и многих других моделей, включая, насколько помню, «пятёрку» или вообще всё семейство пятых моделей ChatGPT. То есть в текущем его виде токенизатор куда крупнее.

    Top-p ограничивает выбор только токенами, суммарная вероятность которых не превышает p.

    А тут вообще может быть ошибка. Насколько я понимаю, собирается минимальный набор из наиболее вероятных токенов, чья суммарная вероятность достигает или превышает порог p.

    Галлюцинации — обратная сторона интеллекта

    Слишком самоуверенное утверждение. Причины для галлюцинаций называют разные, включая особенности обучения и оценочные стимулы, которые поощряли угадывание вместо признания неопределённости ответа. То есть хотя бы частично галлюцинации вполне можно устранить, это не какой-то неизводимый дефект.

    Числа, которых в крупных моделях более триллиона

    Размер флагманских моделей может измеряться сотнями миллиардов параметров, и что-то конкретное про проприетарные БЯМ сказать невозможно, поскольку это всё предмет коммерческой тайны.

    «Память» ChatGPT — это просто очень длинный текстовый файл, который растёт с каждым сообщением и в какой-то момент упирается в лимит контекстного окна.

    В веб-морде уже давно есть память, то есть подсовываемые в контекст сведения о пользователе; также иногда ИИ имеет доступ к другим чатам и может по ним что-нибудь поискать.

    Вообще, все эти поверхностные обсуждения базовых основ несколько невовремя, поскольку сейчас уже давно идёт общение с агентами, которые к тому же самостоятельно сжимают свой контекст.

    Большинство людей представляют языковую модель как умную базу данных: спросил — она нашла ответ и выдала. Это не так.

    Нет, именно это обычно и происходит. Лично я привык пользоваться ChatGPT как интернет-поисковиком. К примеру:

    Знания самой модели меня при этом не интересуют. Думаю, я не один такой.

    Даже обычный чат на ChatGPT.com связан с вызовом инструментов поиска по Интернету, написания кода или генерирования изображений. Здесь же перечисляется поверхностная и устаревшая информация про базовое общение с БЯМ, чем уже года два никто не занимается.


    1. morginalium8
      06.06.2026 12:15

      раунд... есть отдельный вид наслаждения - читать добротный обзор на нейрослоп. вот когда у комментатора настолько подгорело, что он не просто дизлайк поставил, а сам мини-статью написал.