3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать +21 15.08.2026 08:01 ab429 3 Блог компании Selectel Искусственный интеллект IT-инфраструктура Open source
Как и зачем ускоряют LLM +16 07.08.2026 10:10 Magnificus 0 Блог компании BotHub Искусственный интеллект Машинное обучение Серверная оптимизация Программирование
Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99 +11 04.08.2026 10:19 GRADDATA 0 Блог компании VK Tech Блог компании VK Машинное обучение Искусственный интеллект Высоконагруженные системы
Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99 +11 04.08.2026 10:19 GRADDATA 0 Блог компании VK Tech Блог компании VK Машинное обучение Искусственный интеллект Высоконагруженные системы
Как оптимизировать LLM-инференс в 2026 году +18 22.06.2026 15:40 sir-off 2 GPGPU Блог компании Cloud.ru Машинное обучение Параллельное программирование DevOps Искусственный интеллект
Сломанный кэш выглядит как рабочий: prompt caching для тех, кто строит LLM-агентов +1 18.06.2026 07:00 xonika9 0 Машинное обучение Искусственный интеллект
Калькулятор VRAM для локальных LLM: Какие модели ИИ запустятся у вас на компьютере? 16.05.2026 09:04 nlaik 15 Машинное обучение Open source Видеокарты