36 недель. Столько, по моему мнению, занимает путь от нуля до выхода на рынок ML‑инженером. Не 2–3 месяца, как обещают курсы, — чуть дольше. Зато на выходе у вас будет фундамент, с которым можно пройти не только собеседования, но и испытательный срок.

В этой статье — весь маршрут по неделям: что учить, в каком порядке, сколько на это уходит времени и что можно смело отложить до первого оффера.

Сразу оговорюсь. Устроиться ML‑щиком можно и за месяц. Но на испытательном сроке будет очень тяжело, особенно если IT для вас — совершенно новая область. Я предлагаю другой подход: фундаментальная база, нацеленная на прохождение собеседований и комфортную работу на позиции ML‑инженера. При этом всё лишнее я стараюсь выкидывать, а тупиковые ветки обрубать.

Во‑первых, так выше шанс пройти испытательный срок и закрепиться на работе. Во‑вторых, такой фундамент — прочная база для дальнейшего самостоятельного развития в ML.

Немного о себе: меня зовут Ян Шмидт, я ML‑инженер в British Petroleum и параллельно готовлю ребят разного начального уровня к работе ML‑специалистами на рынке СНГ и за рубежом. В настоящее время через мое менторство проходит около 30–45 человек, а еще 15+ других уже устроились. Всё, что ниже помечено как «по моему опыту», — именно оттуда, а не из исследований рынка.

Кто идёт в ML в 2026 году

Прежде чем проходиться по маршруту, посмотрим, кто вообще выбирает по нему идти. С сентября 2025 по сентябрь 2026 мне пришло 114 анкет на менторство. Я прочитал каждую и вручную разметил бэкграунд, уровень и цели.

Это не срез всего рынка, а люди, которые пришли именно ко мне. Но картина, по‑моему, показательная

Кто приходит:

  • 64% уже работают в IT. Самая большая группа — разработчики, четверть всех заявок: Go, фронтенд, Java;

  • 21% вообще не из IT — инженеры‑строители, врачи, биологи, маркетологи, экономисты;

  • 15% — студенты и выпускники без опыта;

  • и только 13% уже работают в ML — приходят за грейдом или чтобы натренировать навык прохождения собеседований.

Возраст — от 17 до 56 лет, каждый седьмой старше 35. Заявки пришли из 19 стран, почти 70% — из России (Москва — 38 человек, Петербург — 17), дальше Казахстан, Беларусь, Испания, Таиланд и даже США, Мексика и Аргентина.

Зачем им ML. 52% — интерес к задачам и науке, 38% — «за этим будущее». Про деньги прямо говорят 26%, но в целях деньги всплывают уже у 36%. И 10% боятся сокращений и замены ИИ.

Главный тренд — валютная удалёнка (ВУ). С сентября 2025 по февраль 2026 на зарубежный рынок целился 31% кандидатов, с марта — уже около 60%. За весь год 52% хотят ВУ, 40% всё равно где, и только 8% явно выбирают рынок России. Меньше всего на зарубеж целятся студенты: им сначала нужен хоть какой‑то первый оффер.

И главная проблема — английский. Свободно им владеют 40% всех кандидатов, а среди тех, кто хочет на ВУ, — 46%. То есть больше половины будущих «валютчиков» пока читают с переводчиком или знают язык на базовом уровне.

С чем приходят. 22% — почти с нуля (нет IT‑опыта, Python около нуля). 43% — основной поток: IT‑база есть, а ML и математика с нуля. Ещё 22% — база хорошая, нужно доучить и упаковать. И 13% уже практикуют ML. По времени 89% готовы учиться больше 15 часов в неделю.

Если собрать всё вместе, типичный кандидат выглядит так: 26 лет, живёт в России, уже работает в IT — чаще всего разработчиком. Python знает, а ML и математику начинает почти с нуля. Готов учиться 15–30 часов в неделю и хочет оффер — желательно на ВУ.

И сразу развею миф: «в ML меньше конкуренции и проще попасть» — нет. Порог входа выше, чем в аналитику или бэкенд. Одна из причин — высшая математика, которая часто становится главным страхом и мешает вообще начать. Поэтому и нужен маршрут, который обрубает ненужные ветки и ведёт к концентрированной базе — той, что встречается почти на каждом ML‑собеседовании и в реальных рабочих проектах.


Карта: 6 этапов

Весь путь — это шесть этапов:

Этап

Недели

Мок‑собеседование

1

База: математика, Python, Git, Linux

1–6

неделя 6 — Python

2

Classic ML

7–11

неделя 11 — Classic ML

3

Deep Learning + Python Advanced

12–17

неделя 15 — Deep Learning

4

Специализация: NLP, LLM, RAG, агенты

18–29, 33–35

недели 27 (NLP), 29 (RAG), 35 (агенты)

5

Резюме, легенда, ML System Design

30–32

неделя 32 — резюме, легенда, MLSD

6

Выход на рынок

36

+

Дополнительно: RecSys, Time Series, MLOps, CV

37–45

Кружки на схеме — мок‑собеседования. После каждого крупного блока стоит проверить знания так, как это делают на настоящем собесе.

Цифры плана:

  • 45 недель, из них 36 обязательных. Остальные 9 — дополнительные темы, к ним можно вернуться уже после выхода на рынок;

  • нагрузка — примерно 18 часов в неделю, в сумме около 650 часов (точнее, 646) на обязательную часть;

  • по ходу — 7 мок‑собеседований.


Сколько идти лично вам

Сроки зависят от старта. Цифры ниже — моя личная оценка по опыту менторства, от первого занятия до выхода на работу.

Стартовый уровень

Срок

Что делать

С нуля: нет IT‑опыта и математики

9–12+ месяцев

Сначала вводный этап: Python + школьная и вузовская математика, потом основной трек

Есть IT‑база, ML и математика с нуля

6–9 месяцев

Полный трек: код учить не надо — математика \to Classic ML \to DL \to проекты \to собесы

Сильная база

3–5 месяцев

Закрыть пробелы, сделать 1–2 сильных проекта и идти на собеседования

Уже работаете в ML

В основном собеседования и рост грейда

Всё упирается в то, сколько времени вы готовы вкладывать и с каким бэкграундом приходите: в зависимости от этого 36 «условных» недель могут сократиться в разы — или растянуться.

Учитывайте сезонность. Ближе к зиме и в первый месяц после Нового года вакансий заметно меньше. Закладывайте это, когда планируете выход на рынок.


Как учиться

До того как начать, стоит разобраться, как вообще учиться.

  • Ведите конспекты — в Notion, Obsidian или любом другом удобном формате. Я советую Obsidian: все заметки хранятся у вас на компьютере.

  • Ошибки. Раньше все гуглили и находили ответ на Stack Overflow — сейчас это быстрее делает нейросеть.

  • Редактор кода. VS Code бесплатный, Cursor — с нейросетью внутри, $20 в месяц. Мне Cursor более чем хватает. Также можно посмотреть в сторону Claude и Codex.


Этап 1. База: математика, Python, Git, Linux

Недели 1–6. Здесь четыре предмета параллельно: математика, Python, Git и Linux.

Почему именно они? Python и математика — самый первый фильтр на любом ML‑собеседовании. Вас могут попросить объяснить базовые понятия из математики, прочитать кусок кода, написать функцию или класс, провести код‑ревью. Это не обязательно задача с LeetCode или Codeforces — но без базы пройти уже не так просто.

Математика: 16 блоков за 4 недели

Неделя

Раздел

Темы

1

Пререквизиты

Нотация: суммы и произведения, принадлежность, кванторы, индикаторы, argmin/argmax, нормы, логарифмы

1–2

Алгебра

Векторы, скалярное произведение, матрицы, тензоры; векторные пространства, базис, линейная (не)зависимость; ранг; определитель, собственные числа и векторы, SVD

2

Математический анализ

Функции одной и нескольких переменных, предел, непрерывность; производные и частные производные, экстремум, градиент; метрика и норма

3–4

Теорвер и матстат

Случайные величины и распределения (нормальное, Бернулли, Пуассона…); матожидание, дисперсия, условная вероятность, теорема Байеса; выборка, bootstrap, гипотезы, доверительные интервалы, ошибки I и II рода, t‑test, A/B‑тест; квантили, ковариация, корреляция; ЦПТ и закон больших чисел

4

Численные методы

Постановка задачи оптимизации, градиентный спуск и его проблемы, принцип максимума правдоподобия

4

Теоретическая информатика

Энтропия и перекрёстная энтропия

Каждый блок — набор отдельных тем: например, векторы и матрицы — это две разные темы.

Какой минимум нужен по математике? Звучит сложно, на практике проще.

  1. Переводите обозначения на человеческий язык. Вектор — это направленный отрезок, набор чисел. Матрица — табличка чисел. Строго говоря, матрица задаёт линейное преобразование из n‑мерного пространства в m‑мерное, но для начала хватит того, что это табличка.

  2. Интуиция производной и градиента: куда и как быстро меняется функция.

  3. Статистика: как принимать решения, когда есть неопределённость.

  4. Градиентный спуск, максимум правдоподобия и кросс‑энтропия — прямая база под функции потерь в машинном обучении.

Подробный разбор математики для ML с примерами — в моей хабровской статье про математику для ML.

Python: три части

  • Python Base — недели 1–4: синтаксис, типы данных, функции, итераторы и генераторы, файлы и контекстные менеджеры, декораторы, исключения, ООП и основные библиотеки — numpy, pandas, matplotlib.

  • Python Algorithms — неделя 5: сложность по времени и памяти, типовые подходы.

  • Python Advanced — позже, на неделях 16–17. Почему так — расскажу в этапе 3.

Алгоритмы: узнать подход, а не вызубрить

Типовые подходы: хеш‑таблица, два указателя, скользящее окно, стек и очередь, DFS/BFS, динамическое программирование. Важно: эти алгоритмы не надо зазубривать и прорешивать сотни задач на LeetCode и Codeforces.

Главный навык скрининга — не вспомнить алгоритм наизусть, а узнать его в условии задачи. Прочитали формулировку — поняли, какой подход нужен. Или получили решение от нейронки — но тогда нужно уметь его объяснить по тому коду, который выдала LLM. Поэтому полностью пропускать этот шаг не стоит, но и тратить на него больше 1–2 недель я не рекомендую.

По моим наблюдениям, алгозадачи на собеседованиях постепенно уходят на второй план — встречаются, например, вайб‑код собеседования. Да, и такое бывает.

Git и Linux

  • Git: важно не заучить команды, а понять, что такое репозиторий, коммит, дифф и ветка — что именно сохраняется и зачем.

  • Linux: уверенно работать в терминале и хотя бы несколько раз своими глазами увидеть основные команды — файлы, пути, поиск, копирование и перемещение, скачивание с серверов.

Позже, на неделях 12–14, Linux добирается до того, что нужно для обучения моделей: процессы, tmux, SSH, scp/rsync, nvidia-smi, OOM и чеклист перед запуском обучения.

Как понять, что база освоена

На шестой неделе — мок‑собеседование по Python. Там проверяют не только синтаксис. Отвечать нужно по схеме: короткий ответ \to уточнение \to пример \to сложность \to крайние случаи. И объяснять, почему вы выбрали именно такое решение, где код может сломаться и как его проверить.


Этап 2. Classic ML

Недели 7–11. Модели на табличных данных: регрессия, классификация, кластеризация, деревья, бэггинг, бустинг. Вопросы по Classic ML на реальных собеседованиях встречаются очень часто: любят спрашивать про различия метрик и лоссов для классификации и регрессии, про бэггинг и бустинг и многое другое. А по моему опыту, большая часть задач в бизнесе — табличные.

Classic ML — шесть блоков. Идём строго по порядку: каждый опирается на предыдущий.

Неделя

Блок

Ключевые темы

7

Постановка задачи и метрики

Обучение с учителем, классификация и регрессия, функции потерь и эмпирический риск, метрики бинарной и многоклассовой классификации, метрики регрессии

8

Валидация

Кросс‑валидация, стратификация, k‑Fold, train/validation/test, bias‑variance, регуляризация, EDA, предобработка и кодирование признаков, пайплайн классической модели

8

Линейные модели и деревья

Логистическая регрессия, решающие деревья, критерии ветвления, регуляризация деревьев, bagging

9

Ансамбли

Random Forest, градиентный бустинг, XGBoost / CatBoost / LightGBM, stacking и blending

9

Кластеризация

Метрики кластеризации, KMeans, DBSCAN, иерархическая кластеризация, KNN

10

Понижение размерности и финальный блок

Наивный Байес, SVM, PCA, t‑SNE, UMAP

Первое, что нужно разложить по полочкам, — разница между функцией потерь и метрикой. Loss оптимизирует модель. Метрика отвечает на вопрос, насколько хорошо модель работает для человека или бизнеса. Для любой задачи вы должны уметь назвать: что здесь объект, что таргет, какие признаки, какой loss и какая метрика.

Минимум по Classic ML:

  • Честная валидация: кросс‑валидация, стратификация, отложенная выборка — и главный вопрос: где может возникнуть утечка данных (leakage) и чем она плоха;

  • bias‑variance: почему модель переобучается и как это заметить;

  • разница между бэггингом, бустингом и стекингом;

Вы освоили Classic ML, если можете пройти кейс на примерах задач классификации, регрессии или кластеризации на табличных данных целиком — от сырых данных до выбранной модели и метрик — и объяснить, почему ваша схема валидации честная.


Этап 3. Deep Learning и Python Advanced

Недели 12–15 — Deep Learning, параллельно доделываем Linux и GitHub. Недели 16–17 — продвинутый Python.

Часть алгоритмов из Classic ML здесь приобретает другую окраску, плюс появляются понятия, которые сейчас постоянно используются и на работе, и на собеседованиях.

Неделя

Блок

Ключевые темы

12

Оптимизаторы

Перцептрон, функции активации, прямой и обратный проход, SGD, Momentum, AdaGrad, RMSProp, Adam, AdamW

13

Гиперпараметры и инициализация

Переобучение и недообучение, инициализация весов, fine‑tuning, warm‑up и schedulers, data drift и concept drift

13

Регуляризация

Batch Normalization, Dropout

13

Свёрточные и рекуррентные сети

Свёртка, pooling, взрыв и затухание градиентов, остаточные связи, RNN / LSTM / GRU, обучение на одной и нескольких GPU, экономия видеопамяти

14

Механизм внимания

Эмбеддинги, attention, self‑/cross‑/multi‑head attention, causal и masked attention, сложность внимания

14

Трансформеры

Архитектура, позиционное кодирование, encoder‑only и decoder‑only модели, Pre‑Norm vs Post‑Norm, увеличение контекста

Минимум здесь такой:

  • как сеть учится: обратное распространение ошибки и оптимизаторы;

  • почему она переобучается и что с этим делать;

  • и главное — attention и трансформер. На трансформере построены почти все современные языковые модели, поэтому, по моему мнению, это самый важный блок этапа. Его обязательно спросят на собеседовании, и он обязательно встретится на работе.

Проверка этапа — мок‑собеседование по Deep Learning на 15-й неделе. Не прошли с первого раза — это нормально: разбираем ошибки и пересдаём.

Почему Python Advanced стоит именно здесь

Недели 16–17: память и конкурентность (сборщик мусора, GIL, threading, multiprocessing, async), ООП и типизация (abc, dataclass, Pydantic), профилирование, линтеры, виртуальные окружения.

После Deep Learning кода становится больше, и писать его нужно как инженер, а не как студент. Нейросети обычно учатся долго, и в процессе случается всякое: утекает или переполняется память, обработка данных идёт слишком медленно. Нужно понимать, где в коде узкие места, как их отследить и по возможности оптимизировать.


Этап 4. Специализация: NLP, LLM, RAG, агенты

Здесь вы выбираете одно направление: NLP, компьютерное зрение, рекомендательные системы или MLOps. В базовом плане это NLP и большие языковые модели — по моему мнению, в 2026 году на них самый большой спрос.

NLP‑трек занимает недели 18–35 — это самый длинный этап, потому что материала очень много:

Недели

Трек

Что внутри

18–21

NLP Base

Как превратить текст в числа: Bag of Words, TF‑IDF, BM25 \to эмбеддинги: Word2Vec, GloVe, FastText \to языковые модели, стратегии генерации, токенизация (BPE, WordPiece, SentencePiece) \to BERT и GPT, метрики генерации, этапы обучения LLM

21–22

Инструменты

Docker, GitHub Advanced, GitHub Workflow (CI)

23

NLP Advanced и обзор LLM

MQA/GQA, RoPE, RMSNorm, MoE; обзор семейств моделей — Llama, Qwen, Mistral, DeepSeek и других

24–26

Оптимизация LLM

Дистилляция, квантизация (GPTQ, AWQ, GGUF), speculative decoding, continuous batching, KV‑cache, LoRA и QLoRA, Flash и Paged Attention

27

Мок‑собеседование

NLP Base / Advanced / Optimization

28–29

RAG + мок

Чанки, загрузка документов, векторный поиск и векторные базы, выбор эмбеддеров, гибридный поиск, reranker, метрики RAG

33–35

Агенты + мок

Structured Output, tool calling, ReAct, LangChain / LangGraph / LlamaIndex, observability, мультиагентные системы, MCP, память, prompt и context engineering

Оптимизация LLM — проще говоря, как запустить большую модель дешевле и быстрее. По моему опыту, это спрашивают далеко не на каждом LLM‑собеседовании. Но пропускать раздел целиком не стоит: базовые термины вроде квантизации, KV‑cache и LoRA с большой вероятностью спросят на интервью.

Если сроки сильно поджимают, раздел оптимизации можно оставить на потом.

RAG — когда модель отвечает не «из головы», не из того, чему она научилась, а по вашим документам: нарезка на чанки, векторные базы, гибридный поиск.

Агенты — когда модель сама вызывает инструменты: tool calling, скиллы, MCP, фреймворки, наблюдаемость, мультиагентность, работа с памятью и контекстом. Сейчас это очень популярная тема: много позиций связано именно с разработкой агентных и мультиагентных систем.

Docker и продвинутый GitHub стоят посередине NLP, на неделях 21–22. Это нужно, чтобы ваши проекты можно было запустить на любой машине и показать работодателю, передать другим командам на тестирование и так далее.

Если вам ближе другое направление — компьютерное зрение, рекомендательные системы, временные ряды или MLOps, — они тоже есть в плане, дополнительными неделями 37–45. Про каждое будет отдельный выпуск серии.

Проверки на этом этапе — три мок‑собеседования: на 27-й неделе по NLP, на 29-й по RAG и на 35-й по агентам.


Этап 5. Резюме, легенда, ML System Design

Обратите внимание: в плане резюме стоит на 30-й неделе — ещё до агентов, а не в самом конце. Упаковываться вы начинаете, пока доучиваетесь.

Упаковка — это резюме, легенда, ML System Design, поиск вакансий и даже подготовка к испытательному сроку. Легенда — это, по сути, убедительный нарратив о вашем профессиональном опыте.

  • Неделя 30 — резюме и легенда.

  • Неделя 31 — ML System Design по проектам из вашего резюме. То есть: как бы вы спроектировали систему, о которой рассказываете на собеседовании. По моему опыту, такие вопросы задают и джунам, и миддлам, и особенно синьорам.

  • Неделя 32 — мок‑собеседование: резюме, легенда и MLSD.


Этап 6. Выход на рынок

Неделя 36 — то, ради чего всё затевалось. HeadHunter, LinkedIn и другие площадки с вакансиями, вопросы по конкретным компаниям, алгоритмические задачи, вопросы HR, вопросы, которые стоит задать интервьюеру в начале и в конце собеседования, роли в Data и ML, словарь IT‑сленга — и даже как оформить ИП или самозанятость.

И важно: оффер — это не финиш. За ним ещё испытательный срок — это тоже часть пути, и к нему тоже нужно готовиться.


Весь план по неделям

Неделя

Что делаем

Часов

Мок

1

Старт: математика, Python и GitHub

20

2

Математика, Python и GitHub Base

20

3

Математика, Python и Linux

17

4

Завершение Python Base и математики

20

5

Python Algorithms: сложность и типовые подходы

20

6

Подготовка к мок‑собесу

10

Python

7

Classic ML: постановка задачи, losses и метрики

18

8

Classic ML: валидация, табличный pipeline и деревья

24

9

Classic ML: ансамбли и кластеризация

24

10

Classic ML: финальный блок

7

11

Подготовка к мок‑собесу

10

Classic ML

12

Deep Learning: оптимизаторы

20

13

DL, Python Advanced и GitHub

20

14

DL: attention, трансформеры и генеративные модели

18

15

Подготовка к мок‑собесу

10

Deep Learning

16

Python Advanced: память и конкурентность

20

17

Python Advanced: ООП, типизация и профилирование

20

18

NLP Base: классические подходы

20

19

NLP Base: эмбеддинги и нейросетевые подходы

20

20

NLP Base: языковые модели и токенизация

20

21

NLP Base: BERT/GPT, GitHub Workflow и Docker

20

22

Инструменты: Docker и GitHub Advanced

24

23

NLP Advanced и обзор LLM

24

24

Оптимизация LLM I

20

25

Оптимизация LLM II

20

26

Оптимизация LLM III

20

27

Подготовка к мок‑собесу

10

NLP Base / Advanced / Optimization

28

RAG

20

29

Подготовка к мок‑собесу

10

RAG

30

Резюме и легенда

20

31

MLSD по проектам из резюме

20

32

Подготовка к мок‑собесу

10

Резюме, легенда, MLSD

33

Агенты I

20

34

Агенты II: память, промптинг и фреймворки

20

35

Подготовка к мок‑собесу

10

Агенты

36

Выход на рынок: профили, площадки, подготовка к собеседованиям

20

Итого обязательная часть

646

7

37

Дополнительно: рекомендательные системы

18

38

Дополнительно: временные ряды

12

39

Дополнительно: MLOps — Kubernetes и Kafka

16

40

Дополнительно: MLOps — облака и базы данных

16

41

Дополнительно: MLOps — трекинг экспериментов (MLflow, W&B, ClearML, TensorBoard)

14

42

Дополнительно: MLOps — мониторинг (Prometheus, Grafana)

12

43

Дополнительно: классическое CV

16

44

Дополнительно: CV на Deep Learning — задачи и метрики

18

45

Дополнительно: CV на Deep Learning — генерация, мультимодальность, архитектуры

18


Правило первого прохода: что отложить

Главное правило, чтобы не утонуть в материале: при первом проходе учите только ядро — обязательный минимум каждой темы. Всё углублённое, дополнительное и исследовательское пропускайте и возвращайтесь к этому потом. В моём роадмапе такой фильтр отсекает больше двухсот тем из 789 — и все они спокойно могут подождать.

Что можно отложить до первого оффера — в плане это недели 37–45:

  • рекомендательные системы;

  • временные ряды;

  • MLOps дальше Docker — Kubernetes, Kafka, облака, трекинг экспериментов, мониторинг;

  • компьютерное зрение, если вы идёте в NLP.

Что важно именно в 2026 году:

  • LLM, RAG и агенты — они уже в обязательной части плана;

  • Docker и Git тоже; полезно понимать и остальные части из раздела MLOps: как проводить трекинг экспериментов (MLflow), мониторинг моделей в продакшене (Loki, Grafana, Prometheus); Linux — основные команды (nvidia-smi, htop, tmux, screen)

  • английский — с первого дня, если вы целитесь в зарубежные компании. Для устройства в СНГ учить английский дополнительно не обязательно. Если с ним всё в порядке, дополнительно учить его не стоит — но очень полезно пройти несколько мок‑собеседований на английском (если целитесь на зарубежную работу).

По возможности проводите мок‑собеседования (пробные собеседования) со своими друзьями/знакомыми/товарищами, которые уже находятся в сфере ML. Обычно все на это охотно соглашаются — и вам помочь, и самим вспомнить детали из собеседований, потренироваться.

Если таких знакомых не имеется, можно походить по различным IT‑сообществам и поспрашивать у людей, кто готов на такой пробный собес (better data community, ods.ai, \dots)


Три частые ошибки

Вот, что я чаще всего вижу у учеников:

  1. Учить всё подряд. Человек в первый же проход лезет в углублённые темы — и через месяц всё ещё сидит в матанализе.

  2. Учиться без проверки. Пока не отвечаешь вслух, кажется, что всё понятно. Мок‑собеседование быстро показывает, где остались трудности.

  3. Откладывать английский «на потом». Из тех, кто хочет в зарубежную компанию, свободно говорят меньше половины. Качайте английский параллельно с ML с первого дня.

  4. Излишне детально изучать отдельные темы. Может появиться соблазн углубиться в определенные темы за подробностями, которые могут завлечь и увести далеко в ненужную сторону. Чтобы не тратить драгоценное время, рекомендую впитывать лишь 70–80% верхнего слоя материала, чтобы не тратить большую часть усилий на оставшиеся 30–20%, которые не принесут особой пользы. Можно будет вернуться к этим деталям, если очень хочется, позже, после устройства.

Как понять, куда углубляться, а какие темы можно пропустить? Для этого можете воспользоваться настоящим roadmap‑ом. Он отсечет лишние пути, способные увести в дебри и украсть много вашего времени без особого профита на пути в освоении ML и получении оффера.


Как тренироваться

Проверяйте себя не чтением, а делом:

  • решайте задачи по каждой теме. Практические задачки можно генерировать нейросетью — ChatGPT, Claude и другими;

  • собирайте небольшие проекты на реальных данных. В открытом доступе полно датасетов, на которых можно обучить модели для классификации, регрессии, кластеризации и других задач;

  • регулярно устраивайте мок‑собеседования — с друзьями, которые тоже переходят в ML, или попросите знакомого ML‑щика погонять вас по самым частым вопросам.

И главный совет: проговаривайте решения вслух. В задачах по Python: идея \to сложность \to крайние случаи — и только потом код. В ML‑задачах: почему выбрана именно эта модель, какие у неё плюсы и минусы, с какими данными вы работаете, какую задачу решаете, какие метрики выбрали. Вы должны уметь интерпретировать своё решение.

Зачастую это важнее, чем умение написать весь код с нуля с закрытыми глазами. Код сегодня почти все пишут с нейронками — компании могут даже выдать вам оплачиваемую подписку на Codex, Cursor или Claude. А вот понимание, что и почему вы делаете, по‑прежнему проверяют на собеседовании.


Итог

База \to Classic ML \to Deep Learning \to специализация \to резюме и MLSD \to выход на рынок. 36 недель, если идти по плану, около 18 часов в неделю и 7 мок‑собеседований по дороге.

Это первый выпуск серии «Roadmap ML 2026». Дальше будут отдельные разборы по NLP и большим языковым моделям, RAG и агентам, компьютерному зрению, рекомендательным системам, временным рядам, MLOps — и отдельно про выход на рынок.

Что дальше?

Чтобы сэкономить время и не утонуть в материале, можно написать мне в Telegram. Подробнее — в профиле.

Есть вопросы?

Пишите в комментариях: на каком вы сейчас этапе и сколько часов в неделю готовы учиться? И какой раздел роадмапа разобрать подробнее в следующих статьях? Спасибо!

Комментарии (28)


  1. ZetaTetra
    15.09.2026 14:57

    А как-же от 15 лет опыта работы с LLM и личное знакомство с Клаудом Шенноном?


    1. versechorus Автор
      15.09.2026 14:57

      Да, или 15 лет опыта с агентами)) Такие знакомства не обязательны, но будут очень сильным подспорьем к резюме)


  1. ToxaBes
    15.09.2026 14:57

    Немного о себе: меня зовут Ян Шмидт, я ML-инженер в British Petroleum и параллельно готовлю ребят разного начального уровня к работе ML-специалистами на рынке СНГ и за рубежом. За два года через моё менторство прошло больше 60 человек, больше 15 из них уже работают в ML — в российских и зарубежных компаниях.

    Ян Шмидт, ментор с 2х летним опытом продает менторство не в хабе "я пиарюсь" и зазывает всех в свою телегу. Совсем, видимо, в British Petrolium не платят.

    При этом 3 из 4 человек, воспользовавшихся его услугами, по итогу не устраиваются в ML сферу.

    Зачем это здесь?


    1. versechorus Автор
      15.09.2026 14:57

      Спасибо за коммент! Вижу, что у вас лычка "В IT уже больше 20 лет". Несколько вопросов:

      Во-первых, откуда информация про 2х-летний опыт?

      Во-вторых, почему из фразы "15 устроившихся и 60 человек" следует, что "3/4 не устраиваются"? Остальные ребята занимаются в настоящий момент на разных этапах: кто-то пришел недавно, кто-то посередине роадмапа, кто-то уже собеседуется. Мне кажется, это должно быть очевидным)) Из всех пришедших за все время покинуло курс человек 5-7 по разным причинам. Никто из дошедших до рынка не покидал курс с поражением

      В-третьих, при публикации статьи на хабр есть отдельная категория "роадмап", её я и выбрал.

      Уверен, что пост может пригодиться тем, кто не понимает, какой нужен маршрут. Я не настаиваю на покупке моего курса. Роадмап есть — дальше по нему можно идти самостоятельно. Отдельно все могут всегда мне написать при необходимости)


      1. ToxaBes
        15.09.2026 14:57

        Ответ тут.


    1. AlekseyPraskovin
      15.09.2026 14:57

      Зачем это здесь?

      Затем, что есть спрос? Что есть заметное количество сокращаемых прямо сейчас разработчиков и "разработчиков", которые привыкли получать 300+ за полтора коммита в неделю и готовы отдать часть этих денежек, чтобы вернуться в привычное состояние?

      А когда есть спрос - будет и предложение. И вот тут на сцену выползает наш "Ян". Который скорее всего совсем и не Ян, но кого это интересует?


      1. versechorus Автор
        15.09.2026 14:57

        Согласен, с рынком, особенно в РФ, сейчас творится что-то невообразимое. Кучу людей сокращают, немало людей заранее приходит с запросом сменить направление на ML с бэка/фронта/aqa/qa/и т.д. Поэтому для меня тоже не стоит вопрос "зачем это здесь" — ответ на поверхности

        P.S. я реально Ян


      1. ToxaBes
        15.09.2026 14:57

        Что есть заметное количество сокращаемых прямо сейчас разработчиков и "разработчиков", которые привыкли получать 300+ за полтора коммита в неделю и готовы отдать часть этих денежек, чтобы вернуться в привычное состояние?

        Так не вернутся, фарш невозможно провернуть назад. Все эти инфоцыгане знают, что ничего из этого не выйдет. Просто потому что прогресс обгоняет те знания которые они якобы дают. Сейчас даже ML-специалисту с опытом тяжело устроиться, про тех кто курсы закончил вообще молчу.

        Вот эту вот продажу иллюзии "будет как раньше" я и осуждаю.


        1. versechorus Автор
          15.09.2026 14:57

          Все эти инфоцыгане знают, что ничего из этого не выйдет

          статистика говорит об обратном, но вам, похоже, виднее))

          прогресс обгоняет те знания которые они якобы дают

          уже несколько раз заметил, что роадмап как раз-таки актуален на состояние 2026. И почему "якобы" — загадка для меня

          даже ML-специалисту с опытом тяжело устроиться

          недостаточно только харды знать идеально и иметь 100500 лет опыта. Нужно уметь и по софтам не проседать: правильно отвечать на собесах, правильно рассказывать по свой опыт. Есть люди, у кого проблемы с самопрезентацией, например, но они могут быть супер спецами из своей узкой области, — да, им тяжелее искать работу будет. Но это проблема хардов или софтов? Недостаточно одних хард-скиллов

          продажу иллюзии "будет как раньше"

          а где эта иллюзия фигурирует в тексте статьи?


          1. ToxaBes
            15.09.2026 14:57

            статистика говорит об обратном, но вам, похоже, виднее))

            Есть три вида лжи...

            уже несколько раз заметил, что роадмап как раз-таки актуален на состояние 2026.

            Вы ошибаетесь, но я не буду подсказывать. Оставайтесь при своем мнении.

            недостаточно только харды знать идеально и иметь 100500 лет опыта

            Да, но без хард скилов софт скилы бесполезны, можно пролезть заболтав и вылететь через месяц. Такие люди как вы плодят стада откликающиеся на кажбую вакансию по 400 откликов в перве 10 минут вакансии в надежде проскочить интервью как учил ментор. Такой спам тоже играет свою роль в том что найм встал.

            а где эта иллюзия фигурирует в тексте статьи?

            А с чего вы решили, что этот ответ вам?

            Я отвечал на комментарий пользователя про "вернуться в привычное состояние".

            Резюмируя, вы даже не во втором десятке "менторов", которых я повидал в этой сфере и пока все они были инфоцыганами. Вы палитесь на ответах, чем больше отвечаете тем больше палитесь.


        1. AlekseyPraskovin
          15.09.2026 14:57

          Так не вернутся, фарш невозможно провернуть назад

          "С хабаром вернулся - чудо. Живой вернулся - удача. Патрульного пуля - везенье. А все остальное - судьба". Надежда всегда продавалась, продается и будет продаваться. Ну по крайней мере пока покупатель - человек, а не агент)


  1. ToxaBes
    15.09.2026 14:57

    Вижу, что у вас лычка "В IT уже больше 20 лет".

    Речь сейчас не обо мне, но если интересно, то 6 лет в ML профессионально (до этого еще 5 лет как хобби, писал статью об этом), 21 год в ИТ всего.

    Во-первых, откуда информация про 2х-летний опыт?

    Вы написали:

    За два года через моё менторство прошло больше 60 человек, больше 15 из них уже работают в ML — в российских и зарубежных компаниях

    Из чего я делаю вывод, что у вас 2х летний опыт менторства в ML.

    Во-вторых, почему из фразы "15 устроившихся и 60 человек" следует, что "3/4 не устраиваются"?

    60/15 = 4, те 1 из 4 устраивается, еще 3 - нет.

    Остальные ребята занимаются в настоящий момент на разных этапах

    Вы написали: За два года через моё менторство прошло больше 60 человек...

    Уже прошло, не проходят сейчас, не собираются, а уже прошло. Если вы нас обманули и еще не прошло, то коэффициент успеха после вашего менторства еще хуже.

    Вы там определитесь, либо трусы либо крестик.

    В-третьих, при публикации статьи на хабр есть отдельная категория "роадмап", её я и выбрал

    По правилам ресурса запрещена откровенна реклама вне корпоративного блога и хаба "я пиарюсь". Можете попробовать рассказать что это не реклама.

    Вообще, сейчас очень много инфоцыган по ML-теме. Я думаю, что вы один из них.


  1. versechorus Автор
    15.09.2026 14:57

    Вы написали:

    За два года через моё менторство прошло больше 60 человек, больше 15 из них уже работают в ML — в российских и зарубежных компаниях

    Из чего я делаю вывод, что у вас 2х летний опыт менторства в ML.

    Согласен, прочитал как опыт в МЛ вообще, не в менторстве — извиняюсь! Да, менторством 2й год занимаюсь.

    Вы написали: За два года через моё менторство прошло больше 60 человек...

    Уже прошло, не проходят сейчас, не собираются, а уже прошло. Если вы нас обманули и еще не прошло, то коэффициент успеха после вашего менторства еще хуже.

    Вы там определитесь, либо трусы либо крестик

    Ок, чтобы не было дальнейших недопониманий — поправлю эту формулировку, спасибо за заметку. Напишу что-то вроде "В настоящее время через мое менторство проходит около 30-45 человек, а еще 15+ других уже устроились". Надеюсь, так меньше людей будет чувствовать себя обманутыми)

    По правилам ресурса запрещена откровенна реклама вне корпоративного блога и хаба "я пиарюсь". Можете попробовать рассказать что это не реклама.

    Давайте дадим администраторам хабра решить этот вопрос. Если удалят пост — я не прав, признаю. Никакого злого умысла — я запостил роадмап. Дальше пусть власть имущие расценят по понятиям))

    Вообще, сейчас очень много инфоцыган по ML-теме. Я думаю, что вы один из них.

    С первым согласен. Со вторым не соглашусь. Я не гарантирую всем 100%-го результата и 300к/наносек каждому, прямо пишу об этом в лендинге, можете глянуть, если вдруг интересно. Странно, что вы даже не зная меня лично утверждаете, что я некомпетентен в менторстве по МЛ и занимаюсь чистым инфоцыганством) Возможно, вам виднее с вышины опыта, но я сомневаюсь, что числа чего-то значат. Результаты менторства говорят за себя, поэтому моя совесть абсолютно чиста) Есть сомнения — в случае заинтересованности любой может связаться с моими учениками.


  1. Katasonov
    15.09.2026 14:57

    Когда же вы уже исчезните как вид облучатели и курсоводы хреновы. А слабо квантовых физиков чеканить за 3-6 месяцев с трудоустройством в Церне сразу?


    1. AlekseyPraskovin
      15.09.2026 14:57

      Когда же вы уже исчезните как вид облучатели и курсоводы хреновы

      Когда найм вернется к норме? И обыватель сможет просто проходить собесы и трудоустраиваться? Так что не переживайте, курсоводы теперь с нами надолго)


    1. versechorus Автор
      15.09.2026 14:57

      Похоже, своим предложением сократить маршрут обучения я открыл портал в ад и сейчас в комменты понабежит куча айтишников с опытом, сопоставимым с моим возрастом)) Роадмапов огромное количество в интернете. Я предложил свой структурированный вариант, актуальный на 2026, отдаю его на изучение) Но в ответ получаю претензии, что только лишь продаю свой «курс», хотя несколько раз уже оговорился, что это вообще не обязательно — можно весь путь самостоятельно пройти. Главное, чтобы у человека были желание и усидчивость

      Искренне не понимаю, что плохого в обучении людей профессии)) Обычных преподавателей в ВУЗе тоже нужно искоренить как вид? Или претензия именно к менторству? Оно ведь и так существует уже не один год — компании периодически назначают сотрудников «менторами», чтобы те помогали стажерам/джунам, да и не только им. Или одни менторы хорошие, а другие — нет?

      Или, может, вы хотите сказать, что айтишником нужно родиться или как минимум оттарабанить несколько лет на стажировке перед устройством? Чтобы, так сказать, все шли по единому пути, который существовал лет 15 назад

      Похоже, это вечный холивар между так называемыми«вкатунами»/теми, кому хочется сменить профессию и теми, кто попал сто лет назад в айти. Хотел бы, чтоб вы подробнее раскрыли свое недоумение. Особенно, раз этот комментарий вызвал одобрение со стороны хабровчан :))


      1. ViacheslavNk
        15.09.2026 14:57

        Я предложил свой структурированный вариант, актуальный на 2026, отдаю его на изучение) 

        Вариант более чем сомнительный, в большинстве случаев он готовит именно тех "вкатунов". Вы на математику отдаете все четыре неделе, алгебра 1-2 недели, ну как можно ее за 1-2 недели пройти, реально нужно проработать учебник типа (если про русскоязычные говорим или переведенные) Ильина   или Кайгородова или Вайнберга, дальше нужно порешать задачи, например задачник Проскурякова или Кострыкина и пр.

        Реально тут нужно закладывать 3-6 месяцев, 4-10 часов в неделю, тогда будет хорошая база по алгебре близкая к университетскому уровню.

        Матанализ, все тоже самое 3-6 месяцев с проработкой учебника например Зорича и решением задач например сборники Антидимидович.

        Теорвер и мат статистика это вообще “преступление” закладывать 2 недели, тервер и мат статистика это самое сложное и важное. Потому что тут нужно уже знать теорию меры, интеграл Лебега, что бы понимать правильно вероятностную меру, математическое ожидание как интеграл Лебега и пр,  

        Тут я бы выделил реально полгода с проработкой учебников Ширяева, Феллера, может кому то зайдет Боровков, прорещиванием задачника например Зубкова, где можно кокнутся уже на десятой задаче.

        Имея базис выше, можно пройти курс по выпуклой оптимизации, туда же и численные методы и пр. То есть математика это реально год-полтора минимум.

         Дальше предметная область, она тоже займет не меньше полугода.


        1. versechorus Автор
          15.09.2026 14:57

          реально нужно проработать учебник типа (если про русскоязычные говорим или переведенные) Ильина   или Кайгородова или Вайнберга, дальше нужно порешать задачи, например задачник Проскурякова или Кострыкина и пр

          я не соглашусь с вами. Вайнберга изучал, да и Куроша и Фаддеевым, но для алгебры — это оверкилл для "вката")) оттуда процентов 5% используется на практике. К чему все остальные темы?

          Матанализ, все тоже самое 3-6 месяцев с проработкой учебника например Зорича и решением задач например сборники Антидимидович

          тоже не согласен. Классическое заблуждение — изучить все книжки ВУЗовского уровня, и что якобы только тогда приоткроется возможность приступить к ML. Я изучал и оба тома Зорича, и Демидовича (анти — это решебник) решал, могу с уверенностью сказать, что оттуда нужны именно те темы, которые я указал в маршруте. Остальные детали нужны для исследовательских позиций

          Теорвер и мат статистика это вообще “преступление” закладывать 2 недели, тервер и мат статистика это самое сложное и важное. Потому что тут нужно уже знать теорию меры, интеграл Лебега, что бы понимать правильно вероятностную меру, математическое ожидание как интеграл Лебега и пр

          так же. "математическое ожидание как интеграл Лебега" не пригодится на собеседованиях даже. Могут спросить 1 раз на 100, но это в рамках погрешности всё.

          Пока вы учите полтора года математику и еще год мл, рынок уже переставит все правила устройства, и вам придется снова приспосабливаться. Спектр знаний для любой области сейчас меняется. С приходом нейронок учиться можно быстрее. Не всегда нужно проштудировать десяток книг для устройства, это алгоритм 10-летней давности, пора пользоваться современными возможностями


          1. ViacheslavNk
            15.09.2026 14:57

            К слову может я изначально Вас не так понял, по сути Вы говорите про подготовку "ML кодера", который уже через полгода не сможет рассказать то такое векторное произведение или дать определение производной, не говоря уже о том что бы посчитать матричное дифференцировании и сможет работать по принципу тут подключили фреймворк, тут загрузили датасет, тут что то сделали по гайду что то получили. Это мне напоминает времена 2000-е когда так же готовили С++, Java и пр программистов за месяц. А я рассуждаю все таки больше про ML ресечера.

            Теперь отвечая на Ваш вопрос зачем это все, это не про прохождение собеседования, такая математическая база позволяет читать научные статьи и тут же реализовывать это в  продукт, как пример в 2020 году вышла статья First Order Motion Model for Image Animation https://arxiv.org/pdf/2003.00196, скажите честно  человек прошедший по вашему гайду сможет реализовать приложение на основе этой статьи приложение. Ребята из МФТИ после прочтения статьи смогли сделать мобильное приложение, помните видео где Илон Маск "пел" песню Земля в иллюминаторе видна? Можно тут послушать https://youtu.be/FlOT52Ydj8w

            Математическая база позволяет понять, что идет не так, позволяет разобраться в проблеме, и.тд. или например столкнувшись с задачей например реализовать систему которая по поведению свинюшек на свинокомплексе позволяет понять когда у нее овуляция (оказывается это очень важно для свинокомплексов) и пр.

            Пока вы учите полтора года математику и еще год мл, рынок уже переставит все правила устройства, и вам придется снова приспосабливаться.

            Вы сейчас, мне кажется, смешиваете фундаментальные знания и прикладные, математика не поменяется за полтора года, максимум могут поменяется прикладные технологии.

            С приходом нейронок учиться можно быстрее. Не всегда нужно проштудировать десяток книг для устройства, это алгоритм 10-летней давности, пора пользоваться современными возможностями

            Я же не слово про алгоритмы не говорил, я лишь говорил про математику.


            1. versechorus Автор
              15.09.2026 14:57

              Похоже, мы реально говорим о разных ролях в ml. Тот путь, который вы описываете, — ML-ресерч. Мой маршрут — больше про более прикладного инженера, и для него полтора года фундаментальной математики до первых практических задач мне кажутся неоправданными

              Я бы не говорил про только лишь "МЛ-кодера": в маршруте есть и производные, и backprop, MLE, оптимизация, иные детали. Понимать, что происходит внутри модели под капотом, уметь её отлаживать — обязательная часть, иначе на работе становится очень сложно, придется в любом случае на практике со всеми вещами ознакомиться, даже если в основное обучение какие-то темы оказались упущенными

              Я не претендую на роадмап для ресерчера в этой статье. Думаю, стоит добавить это в начало статьи, спасибо за конструктивные замечания


            1. AlekseyPraskovin
              15.09.2026 14:57

              это не про прохождение собеседования, такая математическая база позволяет читать научные статьи и тут же реализовывать это в  продукт

              Но человек ничего не реализует, потому что его никто не нанял. Видимо продукт на базе научной статьи он будет пилить за свой счет.


        1. dalerank
          15.09.2026 14:57

          Так ты слона не продашь... (с)


      1. ToxaBes
        15.09.2026 14:57

        Единствнный путь в ML сейчас это дикое упорство и большое количество свободного времени на самобразование. Никому уже не нужен классический ML детально тк его грамотно делает любой харнесс, достаточно базового понимания лесов, бустов и метрик, но нужен опыт, чтобы понимать что кула крутить. Там где его детально спрашивают интервьюверы еще сами не перестроились в реалии нашего дивного нового мира.

        Самая главная тайна, которую инфоцыгане скрывают от свих клиентов заключается в том, что в ML вообще не нужны джуны и мидлы, нужны сразу синьоры. А ими без опыта не стать. Курсы и менторство даже миддла не сделают из кандидата и получается что вся эта толпа ломится в закрытую дверь.

        Реальный вариант вкатывания в ML следуюший: ИТ отдел компании начинает помимо основных задач пытаться делать ML задачи, криво, косо, догло, набивая шишки и набирая опыт. Все остальное это лотерея.


        1. versechorus Автор
          15.09.2026 14:57

          Самая главная тайна, которую инфоцыгане скрывают от свих клиентов заключается в том, что в ML вообще не нужны джуны и мидлы, нужны сразу синьоры. А ими без опыта не стать. Курсы и менторство даже миддла не сделают из кандидата и получается что вся эта толпа ломится в закрытую дверь.

          Поэтому джунов практически не готовят менторы инфоцыгане. Границы грейдов уже давно не такие, как 15 лет назад. И никакого долбления в закрытую дверь)) Ученики и на джунов устраивались, и на синьеров — в зависимости от бекграунда и стремлений

          ИТ отдел компании начинает помимо основных задач пытаться делать ML задачи, криво, косо, догло, набивая шишки и набирая опыт

          кто будет выделять деньги на заведомо убыточный проект ради того, чтобы ии вкорячить очередной в процессы? даже с целью обучить там кого-то из работников. Это не вариант

          Никому уже не нужен классический ML детально тк его грамотно делает любой харнесс, достаточно базового понимания лесов, бустов и метрик, но нужен опыт, чтобы понимать что кула крутить

          тоже не согласен. Есть немало задачек сейчас помимо llm/rag/agents, где пригождается классик мл: от регрессии и классификации до всяких recsys/timeseries штук. Да, какие-нибудь svm/naive bayes отмирают, как мне видится по опыту, но бустинги и бэггинги всякие продолжают жить. Даже на текущем проекте решаем в bp кучу регрессий бустингами над табл данными. Не все задачи автоматически решаются агентами/харнессами.


          1. ToxaBes
            15.09.2026 14:57

            тоже не согласен

            Еще бы вы были согласны.


        1. ManulVRN
          15.09.2026 14:57

          Реальный вариант вкатывания в ML следуюший: ИТ отдел компании начинает помимо основных задач пытаться делать ML задачи

          Это наиболее реалистичный и комфортный вариант вкатывания практически куда угодно))


    1. Excalib
      15.09.2026 14:57

      Неси деньги - будет:)


  1. ViacheslavNk
    15.09.2026 14:57

    А вот пример реального "ML interview":

    I work as a Data Scientist in a big semiconductor company and thinking to switch my career and pursue Big Tech. Recently I finally got an opportunity to have my first ML interview in a well-known company and just wanted to post my experience. Overall, I was quite shocked of the questions and how much I still need to learn. I am pretty good at math and fundamental understanding of ML, which are the most needed skills in semiconductor industry. But the interview was no much about the technical things, but rather understanding of a product. It was a case study interview and surely, I was preparing, reading through examples of the case studies. But since I am not from this industry every new example for me requires some learning effort. Unfortunately, I didn't have a chance to look into the recommender systems and this was exactly what I faced in the interview. Overall, I think it went not so good, the hardest part was not ML itself but discussing particular difficulties and edge cases of the product. Here is some overview containing maybe around 70% since I couldn't memorize all of it. Hopefully, it would helpful for you, guys.

    Q: Let's say we want to start a business to recommend restaurants. How do we make a recommendation list for a user without prior data?

    This is not a difficult question, but I was a bit nervous and said the first thing that came to my mind: we can fetch Google reviews and sort the list. The interviewer obviously was not satisfied and said that I would have millions of good restaurants. I immediately said that we need to sort by location as well. At that moment, my brain kind of thought that the location is already accounted by default so I don't need to even think about it. Weird. I know

    Q: Ok, suppose you have been running your business for some time. How do we modify recommendations?

    I said that we would need to assemble some data and engineer features. Then we discussed features, I listed some of the client behavior, restaurant attributes. After thinking further mentioned delivery features and external conditions like weather or special events.

    Q: What are the models we can start building?

    I wanted to start simple and proposed to calculate cosine similarities or kNN to recommend restaurants closest to the ones user liked.

    Q: Do you think we lack something?

    I was stumbled a bit since the question is a bit generic. The interviewer hinted: "How do we know a user liked a restaurant?". I said that we can do it by reviews. The interviewer said not many people leave reviews. I said we can track user behavior, e.g. if a user ordered more then once from a restaurant or we can monitor click through rate or something like this. The interviewer didn't seem satisfied and explained how he would do it but my brain kind of switched off for a moment and I didn't get the idea.

    Q: What are other more advanced modeling options?

    I proposed a supervised classification approach. We talked a bit on what would be the data: features for different users/restaurant, labels if a user likes a restaurant, possible randomization of samples, like various locations.

    Q: What is the concrete model?

    I said I would start simple with logistic regression.

    Q: What is the cost function for it?

    I said it is binary cross-entropy.

    Q: What else should be in the cost function? Can we have some problems in the data?

    I couldn't immediately come up with problems in the data that should modify the cost function and my brain tried to give me some time for processing this in the background while saying: "We definitely should add regularization". I guess this was not an answer the interviewer expected but he agreed it is needed. He briefly asked why do we need regularization, overfitting problems, difference between L1/L2. But then he came back to his original query.

    Q: Due to the nature of recommender systems there be more problems with your samples.

    Luckily, the background processing in my brain came up with imbalanced classes so mentioned it. This was correct.

    Q: So what can we do about it?

    I mumbled that we can do undersampling to balance the classes and also accuracy is a bad metric and we need to track precision and recall and so on, but reviewer asked can we do something about the cost function first? As you can see he really couldn't let it go. Finally, I got his very first question where this discussion started and replied that we can downweight the samples from a majority class. He said that this is what he wanted to hear.

    Q: So what about correct metrics for imbalanced data?

    I explained about precision and recall and said that I would monitor ROC AUC and Precision&Recall AUC modifying the classification threshold. The interviewer clarified which of the metrics is better for imbalanced data? I actually don't deal much with classification problems in my work so didn't have a sharp answer but started thinking out loud that ROC reflects FPR but doesn't directly account for FNR and then the interviewer kind of finished my thinking process saying that indeed PR AUC is better. I think if I had more time I could have reached this conclusion as well, but perhaps this is what true experts should know without thinking about it.

    Q: What are other industry standard you know for the classification?

    I discussed Gradient Boosted Trees and Random Forest, also mentioned Deep Learning, elaborated a bit of interpretability and memory/computation requirements.

    Q: What are the problems we may have for a new registered restaurant?

    I said that it may have a feature we didn't account for before. However, I couldn't really come up with an idea how to deal with it. The interviewer said that the new restaurant should appear at the top of the list so that users have higher chance to order from it.

    Q: And what should be the users to whom we can propose this new restaurant?

    The ones who has higher probability to like it based on the previous behaviour

    Q: Let's say a user sees top-5 restaurants and choose one. What about the others he doesn't see. Should we mark them as negative?

    I said that obviously not since it will create noise, but I didn't have a clue how to handle that properly. The interviewer explained something but my brain was frozen again and I don't recall what was a correct reply. I only remember that at some point I said "we can randomize this top-5 list".

    Q: Let's say you trained the model is it ready to roll out?

    I mentioned cross-validation etc, but that was not what the interviewer wanted. He said we need to do pilot study. I do know what is A/B testing but my confusion was that I kind of thought this pilot study is by default integrated in the roll-off process for some random users. But from the interviewer perspective I guess it simply looked like I didn't even think about it

    https://www.reddit.com/r/learnmachinelearning/comments/1rhwrct/a_first_big_tech_company_ml_interview_experience/