• Главная
  • Контакты
Подписаться:
  • Twitter
  • Facebook
  • RSS
  • VK
  • PushAll
logo

logo

  • Все
    • Положительные
    • Отрицательные
  • За сегодня
    • Положительные
    • Отрицательные
  • За вчера
    • Положительные
    • Отрицательные
  • За 3 дня
    • Положительные
    • Отрицательные
  • За неделю
    • Положительные
    • Отрицательные
  • За месяц
    • Положительные
    • Отрицательные
  • За год
    • Положительные
    • Отрицательные
  • Сортировка
    • По дате (возр)
    • По дате (убыв)
    • По рейтингу (возр)
    • По рейтингу (убыв)
    • По комментам (возр)
    • По комментам (убыв)
    • По просмотрам (возр)
    • По просмотрам (убыв)
Главная
  • Все
    • Положительные
    • Отрицательные
  • За сегодня
    • Положительные
    • Отрицательные
  • За вчера
    • Положительные
    • Отрицательные
  • За 3 дня
    • Положительные
    • Отрицательные
  • За неделю
    • Положительные
    • Отрицательные
  • За месяц
    • Положительные
    • Отрицательные

Публикации с тегом vllm

RPS одинаковый, но p95 по TTFT хуже в 2,7 раза: что round-robin делает с KV-cache +8

  • 07.10.2026 12:58
  • GRADDATA
  • 0
  • Блог компании VK Tech
  • Блог компании VK
  • nix
  • Системное администрирование
  • Серверное администрирование

RPS одинаковый, но p95 по TTFT хуже в 2,7 раза: что round-robin делает с KV-cache +8

  • 07.10.2026 12:58
  • GRADDATA
  • 0
  • Блог компании VK Tech
  • Блог компании VK
  • nix
  • Системное администрирование
  • Серверное администрирование

Запускаем LLM локально на Windows: WSL2, Docker, CUDA и vLLM +4

  • 06.10.2026 11:41
  • Qwertcoser
  • 3
  • Машинное обучение
  • DevOps
  • GPGPU
  • Linux
  • IT-инфраструктура

Битва поколений: сравниваем Qwen3.5 и Qwen3.6 в локальном инференсе. Новое не всегда лучше +11

  • 30.09.2026 11:06
  • ooptimum
  • 9
  • Искусственный интеллект

Почему инференс LLM становится дорогим и как снизить расходы на GPU без покупки новых карт +10

  • 28.09.2026 11:05
  • sproshchaev
  • 0
  • Блог компании OTUS
  • Машинное обучение
  • Искусственный интеллект
  • DevOps
  • Kubernetes

Выбор агентской модели для кластеров из 2× DGX Spark (сентябрь 2026) +4

  • 24.09.2026 15:06
  • nikkoris
  • 1
  • Искусственный интеллект
  • Машинное обучение
  • Компьютерное железо

Давай по новой, Миша: speculative decoding от черновика до проверки +5

  • 22.09.2026 09:09
  • GG1KENOBI
  • 0
  • Машинное обучение
  • Искусственный интеллект
  • Python
  • Natural Language Processing
  • Программирование

Запустить LLM локально: что считать до покупки видеокарты? +4

  • 18.09.2026 14:16
  • sproshchaev
  • 3
  • Блог компании OTUS
  • Машинное обучение
  • Искусственный интеллект
  • Компьютерное железо
  • Natural Language Processing

Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями +7

  • 11.09.2026 14:58
  • damir9311
  • 7
  • Искусственный интеллект
  • Машинное обучение
  • Операционные системы
  • Серверное администрирование

Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же +5

  • 08.09.2026 09:26
  • Isk4R1oT
  • 0
  • Python
  • Rust
  • Искусственный интеллект
  • Машинное обучение
  • Высоконагруженные системы

LLM зацикливается: как найти причину, не трогая параметры? +7

  • 03.09.2026 16:40
  • sproshchaev
  • 0
  • Блог компании OTUS
  • Машинное обучение
  • Natural Language Processing
  • Искусственный интеллект
  • DevOps

Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег +3

  • 22.08.2026 12:05
  • Tialian
  • 2
  • IT-инфраструктура
  • Искусственный интеллект
  • Финансы в IT
  • DevOps
  • Анализ и проектирование систем

Приватная LLM в облаке: развертываем RAG-систему в Managed Kubernetes +34

  • 20.08.2026 08:01
  • outworld66
  • 0
  • Блог компании Selectel
  • Монетизация IT-систем
  • Kubernetes
  • DevOps
  • Искусственный интеллект

3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать +21

  • 15.08.2026 08:01
  • ab429
  • 3
  • Блог компании Selectel
  • Искусственный интеллект
  • IT-инфраструктура
  • Open source

«Тосок бессмысл»: как я не смог заставить Gemma 4 писать хорошие стихи +13

  • 12.08.2026 07:03
  • dsheremet
  • 6
  • Natural Language Processing
  • Машинное обучение
  • Контент и копирайтинг
  • Искусственный интеллект
  • «
  • 1
  • 2
  • 3
  • 4
  • 5
  • »
Страница 1 из 5
ЛУЧШЕЕ

  • Вчера
  • Позавчера
07:05

Спецэффекты в кино до появления компьютерной графики +48

09:02

STM32: Работа с SD-картами через SDIO +42

07:00

Как мы запустили ИИ-ревьюера на 4000 PR в день — и какие баги он находит +26

10:32

Я б в ИИ-шечку пошёл, пусть меня научат +25

13:01

Тестируем программы для вскрытия биткойн-головоломок с известным публичным ключом +24

08:00

Nginx Proxy Manager на VDS — установка, настройка, порядок в URL’ах +23

11:34

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с +19

12:00

ИИ дешевеет, а ваш компьютер дорожает: как OpenAI и Anthropic устроили гонку цен +17

13:16

Почему не стоит писать AI-агента с нуля: что скрывается внутри harness +14

09:58

Как я менял PagerDuty на self-hosted-решение +14

08:05

Многосегментный Linux-маршрутизатор на Netplan и Nftables: DMZ, SNAT/DNAT, MGMT, диагностика и многое другое +14

06:01

Генеративные тесты — «серебряная пуля» или бесполезный костыль: что говорят разработчики и ученые +14

09:43

Бакеты вместо миллионов строк: как мы ускоряем рассчёты A/B-тестов без потери точности +11

09:36

Математика катастрофы: от дифференциальных уравнений до очередей G/G/1 и формулы Кингмана +11

11:26

NetHackers — открытое сообщество для создания программы, которая сможет стабильно проходить NetHack +10

09:52

Рутину — в скилл, ошибку — в правило. Как я сделал QA-конвейер из скиллов +10

08:01

Домашний ИИ: простой способ добавить «интеллект» своему компьютеру +10

04:41

Я из будущего, и я в ужасе: советские микросхемы глазами современного инженера +10

08:47

Как подключить Claude Code через шлюз и какие модели поддерживают агентный цикл +9

07:01

Как разработать уникальное тиражируемое решение для отрасли? Опыт Integer в создании TMS для фармацевтики +9

12:59

Vim против всех: редактор, в который можно войти, но нельзя выйти +78

15:47

Агент, который меня заменил, или открытия одного интернет‑маркетолога +62

09:01

Аккумуляторы будущего всё ещё боятся маленьких иголок +59

07:00

Открываем код YTsaurus Flow: как обрабатывать более 100 ГБ/с в реальном времени без потерь и дублей +58

13:01

История HTML и CSS. Какие элементы и свойства ушли навсегда +51

08:00

PPU Zhenwu 810E от Alibaba: как китайский AI-ускоритель справляется с LLM +48

14:06

В Китай за embedded-мечтой: программируем микроконтроллеры в SHENZHEN I/O +44

12:00

Октябрьская барахолка под Валенсией: приставка Sony MSX, Raspberry Pi и кое-что еще +34

11:13

Находки в опенсорсе: мир питона за сентябрь 2026 +34

07:01

Как мы создавали решение для автоматизации управления доступами +25

15:29

Скам‑бот в Telegram выдал себя таймером: разбор юзербота с реконструкцией на Telethon +22

09:21

Как мы делали BLE-систему аур для ролевой игры +22

12:32

Почему COALESCE ломает план PostgreSQL и как научить планировщик считать его селективность? +21

12:40

AI‑дайджест #5: агенты выходят на работу, ИИ растворяется в привычных инструментах. Что скажет Лаборатория ИИ? +20

12:10

Сопротивление воздуха: почему дешевый ИИ обходится так дорого +18

08:07

Фреймворк RAFT: как работает RAG на максималках от Microsoft +18

16:54

Собеседования на программиста в эпоху AI +17

12:15

Насколько можно верить спутнику, который измеряет температуру земли +17

07:05

Про дела сырные +17

05:11

Нет другого выбора, кроме как принять ИИ +17

СЕРВИСЫ
  • logo

    CloudLogs.ru - Облачное логирование

    • Храните логи вашего сервиса или приложения в облаке. Удобно просматривайте и анализируйте их.
ОБСУЖДАЕМОЕ

  • Как умрет 1С +1

    • 328

    Vim против всех: редактор, в который можно войти, но нельзя выйти +78

    • 102

    Я из будущего, и я в ужасе: советские микросхемы глазами современного инженера +10

    • 92

    Вайбкодинг. Стадии принятия +13

    • 81

    Собеседования на программиста в эпоху AI +17

    • 44

    Скам‑бот в Telegram выдал себя таймером: разбор юзербота с реконструкцией на Telethon +22

    • 25

    История HTML и CSS. Какие элементы и свойства ушли навсегда +51

    • 24

    Нет другого выбора, кроме как принять ИИ +17

    • 24

    Материальность энергии -1

    • 23

    Отверженные: медицинские термины английского языка, которым уже не рады +7

    • 23

    Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с +19

    • 21

    За что я бы добровольно платил государству +8

    • 20

    Может ли локальная 27B-модель расследовать продакшен-инцидент как Claude? Две RTX 5090, около 40 прогонов и одна гонка +8

    • 20

Подписка


  • Главная
  • Контакты
© 2026. Все публикации принадлежат авторам.