Cached input растёт квадратично +6 02.10.2026 14:33 Flux 5 Ненормальное программирование Искусственный интеллект
Зачем Авито нужна своя Inference-платформа для ML/LLM-сервисов: PaaS vs отдельное решение +5 02.10.2026 10:13 antonaleks605 0 Блог компании AvitoTech Машинное обучение Kubernetes DevOps Искусственный интеллект
Сколько стоит суверенитет -2 27.09.2026 20:44 Mikhail_Khludnev 1 Искусственный интеллект Облачные сервисы
Как сделать интерактивного агента с помощью KV‑кеш‑манипуляций +34 23.09.2026 07:02 mrdarktesla 0 Блог компании Яндекс Машинное обучение Искусственный интеллект Natural Language Processing
Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями +7 11.09.2026 14:58 damir9311 7 Искусственный интеллект Машинное обучение Операционные системы Серверное администрирование
Сайзинг RAM и vCPU для локальной языковой модели: считаем стартовый размер VM 10.09.2026 15:27 SestrichkinK 0 Искусственный интеллект Linux Системное администрирование Серверная оптимизация Высоконагруженные системы
Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же +5 08.09.2026 09:26 Isk4R1oT 0 Python Rust Искусственный интеллект Машинное обучение Высоконагруженные системы
OpenAI Jalapeño: Персональный чип OpenAI, который обогнал NVIDIA Blackwell +5 25.08.2026 20:11 c46fd3da 2 Искусственный интеллект Компьютерное железо Процессоры Машинное обучение
Больше памяти — не значит быстрее: prefill, decode и релиз Apple M5 Ultra +8 25.08.2026 16:54 daniel_ivanov 16 Искусственный интеллект
Как мы внедрили AIOps для контроля GPU‑утилизации и повысили её на 60% +9 20.08.2026 13:30 Rutoves 2 Искусственный интеллект Блог компании RWB
Инференс LLM: от KV-кэша до продакшен-деплоя +10 27.07.2026 05:30 a_ryzhov 4 Блог компании hh.ru Блог компании Конференции Олега Бунина (Онтико) Машинное обучение Высоконагруженные системы Искусственный интеллект
Как оптимизировать инференс LLM: кеширование, время ответа и GPU-ресурсы +29 08.07.2026 07:04 hotckisss 1 Блог компании Яндекс Блог компании Yandex Cloud & Yandex Infrastructure Машинное обучение Искусственный интеллект DevOps
Как работает адаптивный RAG, которому вообще не нужна LLM +22 29.05.2026 12:00 SecretEditor 14 Блог компании MWS AI Блог компании МТС Машинное обучение Алгоритмы Искусственный интеллект
Как работает адаптивный RAG, которому вообще не нужна LLM +22 29.05.2026 12:00 SecretEditor 14 Блог компании MWS AI Блог компании МТС Машинное обучение Алгоритмы Искусственный интеллект
Дезагрегированный инференс LLM в Kubernetes: префилл, декодирование и планирование подов 27.05.2026 12:09 GRADDATA 0 Блог компании VK Tech Машинное обучение IT-инфраструктура Облачные вычисления Kubernetes