Хватит сливать данные в Claude и GPT: как поднять свой on‑prem LLM +18 04.08.2026 13:01 net0pyr 2 Блог компании RUVDS.com Информационная безопасность Искусственный интеллект Системное администрирование Облачные сервисы
Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99 +11 04.08.2026 10:19 GRADDATA 0 Блог компании VK Tech Блог компании VK Машинное обучение Искусственный интеллект Высоконагруженные системы
Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99 +11 04.08.2026 10:19 GRADDATA 0 Блог компании VK Tech Блог компании VK Машинное обучение Искусственный интеллект Высоконагруженные системы
Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле +8 04.08.2026 09:34 0xReality 16 Искусственный интеллект Компьютерное железо Машинное обучение Облачные сервисы Финансы в IT
DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57 +7 03.08.2026 14:32 AGmind 13 Машинное обучение Искусственный интеллект Natural Language Processing Open source
Гибридные трансформеры под нагрузкой: где Gated DeltaNet проигрывает full attention +3 31.07.2026 12:54 YUNGC0DE 0 Машинное обучение Искусственный интеллект
350+ моделей без смены SDK: зачем разработчику слой абстракции над LLM‑провайдерами +9 29.07.2026 08:32 just_ai 0 Блог компании Just AI Искусственный интеллект Машинное обучение Программирование Проектирование API
Локальный запуск LLM для SOC: сколько инцидентов обработает одна GPU? Часть 2 +4 27.07.2026 11:44 rvteam 3 Информационная безопасность Блог компании R-Vision
Инференс LLM: от KV-кэша до продакшен-деплоя +10 27.07.2026 05:30 a_ryzhov 4 Блог компании hh.ru Блог компании Конференции Олега Бунина (Онтико) Машинное обучение Высоконагруженные системы Искусственный интеллект
vLLM vs LMDeploy vs Triton: обзор бэкендов для инференса LLM +35 18.07.2026 08:00 IAlexOps 0 Блог компании Selectel Искусственный интеллект Программирование IT-инфраструктура Видеокарты
Локальный запуск LLM для SOC: сколько GPU действительно нужно? +4 17.07.2026 10:41 rvteam 2 Блог компании R-Vision Машинное обучение Искусственный интеллект Информационная безопасность
DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново +4 05.07.2026 16:22 AGmind 2 Open source Искусственный интеллект Машинное обучение
Полез в исходники vLLM, чтобы понять, почему один символ убивает prompt caching -1 02.07.2026 07:00 xonika9 0 Искусственный интеллект Машинное обучение Open source Программирование Высоконагруженные системы
Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front +8 27.06.2026 16:21 Happynood 1 Машинное обучение Python Open source Высоконагруженные системы DevOps
Облачная LLM на 16 ГБ VRAM — часть 3: ChatGPT-интерфейс для ваших LangGraph-агентов +23 27.06.2026 08:00 yakvenalex 2 Блог компании Selectel Искусственный интеллект Python NestJS DevOps