Автор: Лыков Александр, к.ф.-м.н., академический руководитель Школы Высшей Математики и ШАД Хелпера.
В статье мы приведём результаты решения задач с первого этапа вступительного экзамена в ШАД в 2026 от ИИ.
Что мы проверяли.
На первом этапе поступающим предлагалось решить 40 задач из разных разделов математики и алгоритмов за два часа. Более подробно о том, как проходила вступительная кампания в ШАД в 2026 году описано в статье. На экзамене проверялся только ответ, решение не смотрели. Всего было четыре варианта: A, B, C, D. Список задач можно посмотреть тут.
Мы взяли все задачи с первого этапа и посмотрели, как их решали различные LLM. Мы не ставили целью сравнивать между собой LLM. Скорее мы хотели оценить возможность ИИ в целом пройти первый этап отбора в ШАД.
Результаты
Ниже таблица с результатами:
Модель |
Средний балл |
% правильных |
Время |
|---|---|---|---|
Claude: Opus, 4.8 |
39.5 / 40 |
98.8% |
25 мин |
DeepSeek-R1-0528 |
38.25 / 40 |
95.6% |
43 мин* |
ChatGPT: Sol, Medium |
37.75 / 40 |
94.4% |
14 мин |
Qwen 3.7 Max |
32.5 / 40 |
81.3% |
155 мин |
Gigachat-3-Ultra |
25.25 / 40 |
63.1% |
3–4 мин |
Таблицы по вариантам:
Score |
A |
B |
C |
D |
Average |
|---|---|---|---|---|---|
Claude: Opus, 4.8 |
40 |
40 |
40 |
38 |
39.5 |
DeepSeek-R1-0528 |
40 |
40 |
37 |
36 |
38.25 |
ChatGPT: Sol, Medium |
37 |
40 |
38 |
36 |
37.75 |
Qwen 3.7 Max |
32 |
27 |
35 |
36 |
32.5 |
Gigachat-3-Ultra |
31 |
24 |
28 |
18 |
25.25 |
Модели DeepSeek и Gigachat мы тестировали с помощью API к моделям и Python-скрипта. Остальные модели с помощью harness’ов. Для Claude и ChatGPT взяли Github Copilot, для Qwen использовали Qwen CLI.
Строго говоря, результат зависит не только от самих языковых моделей, но и от конкретных способов их использования: API или coding harness.
Проходной балл был в районе 30. Поэтому все зарубежные LLM прошли бы первый этап. Обратим внимание, что мы использовали не самые мощные модели, доступные сейчас, так как задачи с первого этапа достаточно простые. Взяли те, что “были под рукой”.
Репозиторий с решениями, проверкой и Python-скриптами
Кто на чём ошибался
Распределение задач по предметам
Предмет \ Вариант |
A |
B |
C |
D |
|---|---|---|---|---|
Математический анализ |
10 |
10 |
10 |
10 |
Алгебра, включая линейную |
10 |
10 |
10 |
10 |
Теория вероятностей |
10 |
10 |
10 |
10 |
Дискретная математика |
5 |
5 |
5 |
5 |
Алгоритмы и структуры данных |
5 |
5 |
5 |
5 |
Итого задач |
40 |
40 |
40 |
40 |
В дискретную математику включены комбинаторные задачи, задачи о графах, подсчётах конфигураций и перестановках. Аналитическая геометрия и задачи с матрицами отнесены к алгебре.
Топ тем по каждому предмету с указанием количества задач на заданную тему (составлено ИИ):
Предмет |
Тема-победитель |
A |
B |
C |
D |
|---|---|---|---|---|---|
Математический анализ |
Дифференцируемость, теоремы о среднем и формула Тейлора |
4 |
4 |
4 |
4 |
Алгебра |
Линейные операторы и спектральная теория |
5 |
5 |
3 |
3 |
Теория вероятностей |
Математическое ожидание и дисперсия, включая условное матожидание |
4 |
3 |
4 |
4 |
Дискретная математика |
Комбинаторика: сочетания, перестановки и подсчёт конфигураций |
4 |
5 |
4 |
4 |
Алгоритмы и структуры данных |
Анализ сложности алгоритмов |
4 |
4 |
3 |
3 |
Далее проанализируем систематические ошибки моделей.
Задач, в которых ошиблись все пять моделей, не выявлено.
По предметам такая статистика:
Предмет |
Средний балл всех моделей |
|---|---|
Математический анализ |
94.1% |
Линейная алгебра и геометрия |
90.8% |
Дискретная математика |
89.5% |
Теория вероятностей |
89.3% |
Алгоритмы и структуры данных |
85.5% |
По темам.
Тема программы |
Задачи |
Средний балл |
|---|---|---|
Системы линейных уравнений |
C23, D23 |
60.0% |
Амортизационный анализ |
A36–D36 |
67.5% |
Характеристические функции |
A9–D9 |
72.5% |
Минимальные остовные деревья |
C39, D39 |
75.0% |
Геометрическая вероятность |
A4–D4 |
80.0% |
Дифференцируемость высокого порядка |
A16–D16 |
80.0% |
Условная вероятность и формула Байеса |
A1, A2, B1, B2, C2, D2 |
80.0% |
Алгоритм Дейкстры и функции стоимости пути |
C40, D40 |
80.0% |
Определители и обратные матрицы |
8 задач |
83.8% |
Включения-исключения |
B35, C35, D35 |
86.7% |
Сходимость и предельные теоремы |
A10–D10 |
87.5% |
Модель |
Наиболее слабые темы |
|---|---|
Claude |
Слабых тем не выявлено: 99% во всех представленных темах |
DeepSeek |
Системы линейных уравнений — 50%; классическая/комбинаторная вероятность — 75%; условные моменты и дисперсия — 83.3% |
ChatGPT |
Системы линейных уравнений — 0%; амортизационный анализ — 75%; характеристические функции, рекуррентные соотношения и определители — по 87.5% |
Qwen |
Характеристические функции — 50%; минимальные остовные деревья — 50%; комбинаторика последовательностей — 50%; определители — 56.3%; условная вероятность и Байес — 58.3%; амортизационный анализ — 62.5% |
GigaChat |
Амортизационный анализ и Дейкстра — 0%; дифференцируемость высокого порядка — 12.5%; геометрическая вероятность, MST и обратимость матричных выражений — по 25% |
Универсальной слабости всех моделей нет. Совокупно наиболее труден алгоритмический блок, но результат сильно зависит от модели.
Сколько времени и денег это стоило
Таблица времени выполнения задач в минутах
Time (min) |
A |
B |
C |
D |
|---|---|---|---|---|
Claude: Opus, 4.8 |
25 |
25 |
25 |
25 |
DeepSeek-R1-0528 |
22 |
22 |
39 |
43 |
ChatGPT: Sol, Medium |
14 |
14 |
14 |
14 |
Qwen 3.7 Max |
155 |
155 |
155 |
155 |
Gigachat-3-Ultra |
3 |
3.1 |
3.6 |
3.6 |
Github Copilot и Qwen CLI решали варианты параллельно. Поэтому, например, Claude решил все варианты за 25 минут. Qwen CLI долго пыхтел, перезапускал себя, разбивал задачу на куски, но не сдавался. В итоге через 155 минут всё решил, но с ошибками.
По деньгам: Claude, ChatGPT входят в 20-долларовую подписку. DeepSeek потратил 15 центов на один вариант, Gigachat-3-Ultra выдаёт бесплатные токены на свою модель.
Gemini, который списал у DeepSeek
Мы также провели эксперимент для Gemini 3.1 Pro (Preview), Medium + Github Copilot. Но по результатам он был дисквалифицирован. И вот по какой причине.
При первом прогоне он поразительно быстро нашёл решения - за 2.5 минуты. При дальнейшем с ним диалоге он мне написал:


Иными словами, в эксперименте агент на Gemini обнаружил в рабочей директории решения DeepSeek и скопировал их, а в последующих запусках не выполнил задание полностью. Агент оптимизировал выполнение поставленной задачи, а не соблюдение неявного намерения экспериментатора. Это фича нашей методики, а не модели.
Так что нужно быть аккуратным в таких экспериментах.
При повторных запусках он упорно отказывался решать задачи. Ссылался на то, что их очень много, нужно разбивать на подзапросы и т.д., как студент-троечник. Дисквалификация.
Выводы
Первый вывод состоит в том, что имея подписку за $20 на ЛЛМ можно пройти первые два этапа вступительных испытаний в ШАД (про прохождение второго этапа мы писали в статье). Неужели онлайн-экзамены после таких результатов имеют право на жизнь?
Второй вывод грустный - наиболее сильная отечественная ЛЛМ, Gigachat, не прошла бы и первый этап вступительных экзаменов в ШАД (проходной балл был не ниже 30). Но мы надеемся и верим, что разработчики GigaChat к следующим экзаменам нас порадуют и GigaChat пройдёт все этапы.
Мы категорически против списываний и использования ЛЛМ на любых экзаменах, где это запрещено. Экзамен - это соревнование и нужно иметь мужество участвовать в нём честно и добросовестно. Кроме того, неизвестно, насколько могут заблокировать абитуриенту право ещё раз сдавать вступительные экзамены в случае обнаружения списывания.
Анализ не выявил “гробовых” задач, которые бы ни одна ЛЛМ не смогла осилить. Также нет систематических пробелов по разделам и темам. Ошибки разных LLM слабо совпадают: задача, сложная для одной модели, зачастую без проблем решается другой. Это скорее похоже не на общий предел современных LLM, а на особенности конкретных моделей.
Комментарии (3)

m0xf
25.08.2026 12:33Проверил пять задач на локальном Qwen 3.8 27B. Получил пять правильных ответов. Что интересно, модель дала правильный ответ на задачи, с которыми не справился облачный Qwen 3.7.

Travvy
25.08.2026 12:33А почему кстати был взят deepseek R1, который уже довольно старенький? Есть же v4-pro, который тоже ризонит и на многих бенчах хорош? хотя и старичок R1 нормально справился))
Plesser
А будете ли в как то адаптировать задачи что бы избежать использование ИИ?