Сервис снова работает после перезапуска, но причина сбоя так и осталась неизвестной. Пайплайн проходит проверки, а перед релизом всё ещё приходится править файлы вручную. Такие ситуации заставляют возвращаться к устройству системы: разбираться, где теряется трафик, чего не видно в мониторинге и какие действия стоит автоматизировать.
В этом дайджесте собрали бесплатные вебинары, статьи и курсы для тех, кто развёртывает и поддерживает инфраструктуру. Темы — от диагностики Linux и сетей до Kubernetes и эксплуатации ИИ-агентов. Можно начать с конкретной рабочей проблемы или выбрать направление, в котором пора углубить знания.
Маршрут
Инфраструктурные задачи: что можно разобрать на вебинарах
В подборке — темы от настройки SSH до диагностики Kubernetes и эксплуатации ИИ-агентов. Все уроки проведут преподаватели Otus, можно будет задать вопросы и познакомиться с форматом обучения. Участие бесплатное, нужно зарегистрироваться.
Linux и администрирование серверов
23 сентября, 20:00. Linux на практике: безопасный доступ к серверу и автоматизация через SSH (предзаписанный вебинар)
24 сентября, 19:00. Сможет ли ИИ починить Linux-сервер: где заканчиваются подсказки и начинается инженерная диагностика
Kubernetes и автоматизация развёртывания
1 октября, 20:00. Kagent + Ollama: ИИ-агент для работы с Kubernetes
7 октября, 20:00. GitOps-практики: развертываем сервис через ArgoCD
15 октября, 20:00. Поднимаем кластер Kubernetes с помощью Terraform и Ansible
Мониторинг и диагностика
23 сентября, 20:00. eBPF: рентгеновское зрение для production
14 октября, 20:00. ИИ для мониторинга: что Prometheus и Grafana могут рассказать агенту
20 октября, 20:00. OpenTelemetry в .NET: от чёрного ящика к наблюдаемой системе
Сетевая инфраструктура и безопасность
5 октября, 19:00. Автоматические TLS-сертификаты: модуль ACME (Angie)
20 октября, 19:00. Балансировка HTTP и L4 сервисов в Angie (Angie)
21 октября, 20:00. Пентест инфраструктуры: поиск слепых зон IDS/IPS
Отказоустойчивость баз данных и обмен сообщениями
23 сентября, 20:00. Как использовать Patroni для управления высокодоступными кластерами PostgreSQL
6 октября, 20:00. Apache Kafka в микросервисной архитектуре — лучшие практики асинхронного обмена
21 октября, 20:00. Apache Kafka: быстрый старт для разработчиков и инженеров
MLOps и эксплуатация ИИ-агентов
12 октября, 20:00. Сколько стоит один ответ вашего AI-агента — и почему он думал 40 секунд?
15 октября, 18:00. Автоматизация ML-экспериментов с помощью GitLab CI/CD и CML
27 октября, 18:00. Langfuse в AgentOps: наблюдаемость и оценка LLM-агентов

Что почитать: Kubernetes, сети и CI
Авторы разбирают, откуда возникают проблемы, как их диагностировать и какие настройки помогают избежать повторения.
Как выстроить доверенный TLS в Kubernetes без InsecureSkipVerify
Как настроить единый контур доверия для внутренних сервисов, внешнего трафика и kubelet с помощью cert-manager, trust-manager и CA. С практическими манифестами и проверкой сертификатов.Ищем петли и шторма в L2 сети
Практическая методика диагностики сетевой аварии по загрузке портов, состоянию STP и MAC-флапингу. Показано, как локализовать источник сбоя и защитить коммутаторы от его повторения.4 антипаттерна CI‑автоматизации, из‑за которых команда делает работу за ботов
Почему комментарии CI, линтеров и ИИ-ревью часто лишь добавляют разработчикам ручную работу. Разбор способов перенести в пайплайн сами исправления: от версионирования до правок кода.От capabilities к AppArmor: что реально остановит атакующего в контейнере
На примере скомпрометированного контейнера показано, какие действия блокируют capabilities, seccomp и AppArmor. Разбор помогает понять границы каждого механизма и собрать многоуровневую защиту.Kubernetes: архитектура и абстракции — полный гайд
Как устроен Kubernetes-кластер: от Control Plane и Worker Nodes до Pod, Service, Deployment и Namespace. В материале также разобраны ошибки эксплуатации и базовые практики для продакшена.

Когда инфраструктурные задачи становятся сложнее
По мере роста систем приходится глубже разбираться в Kubernetes, CI/CD, сетевой инфраструктуре, мониторинге и эксплуатации ИИ-сервисов. Эти курсы подойдут специалистам с опытом, которым нужно систематизировать знания и увереннее работать со сложными сценариями в продакшене.
до 27 сентября на курсы октября действует скидка 10%
AgentOps: эксплуатация AI-агентов
Старт потока: 30 октября
Курс для AI/LLM-инженеров, DevOps, SRE и архитекторов, которые отвечают за работу ИИ-агентов в продакшене. В программе — наблюдаемость и трассировка, оценка качества, диагностика сбоев, безопасность и разбор инцидентов с использованием OpenTelemetry, Langfuse и других инструментов AgentOps.
ИИ в работе DevOps-инженера
Старт потока: 30 октября
Курс рассчитан на DevOps-инженеров, системных администраторов и разработчиков с опытом эксплуатации инфраструктуры. Программа охватывает применение ИИ при работе с Terraform, Ansible, CI/CD и Kubernetes, анализе метрик и логов, расследовании инцидентов и проверке безопасности конфигураций. Итоговый проект — ИИ-агент для выполнения многошаговых задач в инфраструктурном контуре.
DevOps. Экспертный уровень
Старт потока: 29 октября
Продвинутый курс для инженеров, которые уже знакомы с Docker, Terraform, Ansible, CI/CD и основными концепциями Kubernetes. В программе — управление инфраструктурой как кодом, настройка GitLab CI/CD, эксплуатация Kubernetes, мониторинг с Prometheus и Grafana, работа с Vault и сценарии автоматизации с помощью ИИ. Вступительный тест поможет узнать, есть ли пробелы в знаниях.
Администрирование Nginx/Angie
Старт потока: 28 октября
Курс для Linux-администраторов и веб-разработчиков, которым нужно глубже разобраться в эксплуатации Nginx и Angie. На практических примерах рассматриваются балансировка нагрузки, отказоустойчивость, проксирование, автоматическая настройка HTTPS, мониторинг через Prometheus и управление конфигурацией по API. В программу также входит работа с Angie Pro и Angie Ingress Controller для Kubernetes.