35B-модель на RTX 5080 и RTX 3060: 109 ток/с через PCIe Gen2 x4 29.09.2026 20:26 aigen31 0 Машинное обучение Программирование GPGPU Open source Python
Дело о лишних размышлениях: почему вредно много думать +5 07.09.2026 08:23 Homosum 5 Искусственный интеллект Компьютерное железо
Дело о 38 токенах в секунду: почему M3 Ultra начинал с двенадцати +5 28.08.2026 09:05 Homosum 2 Искусственный интеллект Компьютерное железо
Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег +3 22.08.2026 12:05 Tialian 2 IT-инфраструктура Искусственный интеллект Финансы в IT DevOps Анализ и проектирование систем
Топ вопросов с NLP собеседований: архитектуры LLM, инференс и оптимизация -1 10.08.2026 19:15 abletobetable 0 Машинное обучение Natural Language Processing Искусственный интеллект
Гибридные трансформеры под нагрузкой: где Gated DeltaNet проигрывает full attention +3 31.07.2026 12:54 YUNGC0DE 0 Машинное обучение Искусственный интеллект
Локальный запуск LLM для SOC: сколько инцидентов обработает одна GPU? Часть 2 +4 27.07.2026 11:44 rvteam 3 Информационная безопасность Блог компании R-Vision
Почему дорогая LLM дороже: экономика инференса, которую видно в твоём 5-часовом лимите +5 02.07.2026 22:37 Raicon 2 Искусственный интеллект Natural Language Processing Машинное обучение Программирование Исследования и прогнозы в IT
Полез в исходники vLLM, чтобы понять, почему один символ убивает prompt caching -1 02.07.2026 07:00 xonika9 0 Искусственный интеллект Машинное обучение Open source Программирование Высоконагруженные системы
Как я установил в свой игровой ПК серверный GPU за £200 +62 05.06.2026 13:01 Bright_Translate 33 Блог компании RUVDS.com Искусственный интеллект Машинное обучение Компьютерное железо Видеокарты
Как развернуть Mistral 7B на GPU-сервере через vLLM 20.05.2026 08:00 natlysky 4 Блог компании Selectel Машинное обучение Системное администрирование Облачные сервисы Видеокарты
Скрытая цена LLM: как KV-cache увеличивает стоимость инференса и как эту проблему решает Google TurboQuant +21 04.05.2026 07:00 konstantin_kozhin 0 Блог компании МТС Искусственный интеллект Машинное обучение Natural Language Processing Сжатие данных