• Главная
  • Контакты
Подписаться:
  • Twitter
  • Facebook
  • RSS
  • VK
  • PushAll
logo

logo

  • Все
    • Положительные
    • Отрицательные
  • За сегодня
    • Положительные
    • Отрицательные
  • За вчера
    • Положительные
    • Отрицательные
  • За 3 дня
    • Положительные
    • Отрицательные
  • За неделю
    • Положительные
    • Отрицательные
  • За месяц
    • Положительные
    • Отрицательные
  • За год
    • Положительные
    • Отрицательные
  • Сортировка
    • По дате (возр)
    • По дате (убыв)
    • По рейтингу (возр)
    • По рейтингу (убыв)
    • По комментам (возр)
    • По комментам (убыв)
    • По просмотрам (возр)
    • По просмотрам (убыв)
Главная
  • Все
    • Положительные
    • Отрицательные
  • За сегодня
    • Положительные
    • Отрицательные
  • За вчера
    • Положительные
    • Отрицательные
  • За 3 дня
    • Положительные
    • Отрицательные
  • За неделю
    • Положительные
    • Отрицательные
  • За месяц
    • Положительные
    • Отрицательные

Публикации с тегом inference

Cached input растёт квадратично +6

  • 02.10.2026 14:33
  • Flux
  • 5
  • Ненормальное программирование
  • Искусственный интеллект

Зачем Авито нужна своя Inference-платформа для ML/LLM-сервисов: PaaS vs отдельное решение +5

  • 02.10.2026 10:13
  • antonaleks605
  • 0
  • Блог компании AvitoTech
  • Машинное обучение
  • Kubernetes
  • DevOps
  • Искусственный интеллект

Сколько стоит суверенитет -2

  • 27.09.2026 20:44
  • Mikhail_Khludnev
  • 1
  • Искусственный интеллект
  • Облачные сервисы

Как сделать интерактивного агента с помощью KV‑кеш‑манипуляций +34

  • 23.09.2026 07:02
  • mrdarktesla
  • 0
  • Блог компании Яндекс
  • Машинное обучение
  • Искусственный интеллект
  • Natural Language Processing

Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями +7

  • 11.09.2026 14:58
  • damir9311
  • 7
  • Искусственный интеллект
  • Машинное обучение
  • Операционные системы
  • Серверное администрирование

Сайзинг RAM и vCPU для локальной языковой модели: считаем стартовый размер VM

  • 10.09.2026 15:27
  • SestrichkinK
  • 0
  • Искусственный интеллект
  • Linux
  • Системное администрирование
  • Серверная оптимизация
  • Высоконагруженные системы

Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же +5

  • 08.09.2026 09:26
  • Isk4R1oT
  • 0
  • Python
  • Rust
  • Искусственный интеллект
  • Машинное обучение
  • Высоконагруженные системы

OpenAI Jalapeño: Персональный чип OpenAI, который обогнал NVIDIA Blackwell +5

  • 25.08.2026 20:11
  • c46fd3da
  • 2
  • Искусственный интеллект
  • Компьютерное железо
  • Процессоры
  • Машинное обучение

Больше памяти — не значит быстрее: prefill, decode и релиз Apple M5 Ultra +8

  • 25.08.2026 16:54
  • daniel_ivanov
  • 16
  • Искусственный интеллект

Как мы внедрили AIOps для контроля GPU‑утилизации и повысили её на 60% +9

  • 20.08.2026 13:30
  • Rutoves
  • 2
  • Искусственный интеллект
  • Блог компании RWB

Инференс LLM: от KV-кэша до продакшен-деплоя +10

  • 27.07.2026 05:30
  • a_ryzhov
  • 4
  • Блог компании hh.ru
  • Блог компании Конференции Олега Бунина (Онтико)
  • Машинное обучение
  • Высоконагруженные системы
  • Искусственный интеллект

Как оптимизировать инференс LLM: кеширование, время ответа и GPU-ресурсы +29

  • 08.07.2026 07:04
  • hotckisss
  • 1
  • Блог компании Яндекс
  • Блог компании Yandex Cloud & Yandex Infrastructure
  • Машинное обучение
  • Искусственный интеллект
  • DevOps

Как работает адаптивный RAG, которому вообще не нужна LLM +22

  • 29.05.2026 12:00
  • SecretEditor
  • 14
  • Блог компании MWS AI
  • Блог компании МТС
  • Машинное обучение
  • Алгоритмы
  • Искусственный интеллект

Как работает адаптивный RAG, которому вообще не нужна LLM +22

  • 29.05.2026 12:00
  • SecretEditor
  • 14
  • Блог компании MWS AI
  • Блог компании МТС
  • Машинное обучение
  • Алгоритмы
  • Искусственный интеллект

Дезагрегированный инференс LLM в Kubernetes: префилл, декодирование и планирование подов

  • 27.05.2026 12:09
  • GRADDATA
  • 0
  • Блог компании VK Tech
  • Машинное обучение
  • IT-инфраструктура
  • Облачные вычисления
  • Kubernetes
  • «
  • 1
  • 2
  • 3
  • »
Страница 1 из 3
ЛУЧШЕЕ

  • Сегодня
  • Вчера
  • Позавчера
00:38

Сколько же близких звёзд мы проглядели? +29

08:05

Скоро распродажи, пора за игровыми приколами. Какую ретро-консоль купить в 2026 году и кайфануть на все деньги +28

09:01

Отключение мозга ничего хорошего не сулит +26

07:22

Собираю робота на Raspberry Pi 5 для дочери. Но говорящей колонкой тут не отделаться! Вызов принят, погнали +26

11:17

Сделал браузерное расширение, чтобы сохранять иностранные слова прямо из статей и потом учить их в мобильном приложении +18

13:01

Corvus Concept — «облачная» сетевая рабочая станция из 1982 года +17

09:55

Aquilum — быстрый аналог Obsidian на Rust, который потребляет около 27 МБ ОЗУ +15

08:04

Я завёл реестр реестров. Теперь в России на один реестр больше +15

12:22

Теорема о четырёх красках получила новое редкое доказательство +12

10:13

Утро без телефона: зачем я поставил рядом с кроватью матричный принтер +10

01:01

От bare metal до managed Kubernetes: разбираем архитектуру Cozystack. Расшифровка митапа в Дубае +10

13:22

Космос удивляет: у астероида обнаружились кольца. Что происходит? +8

12:30

Первые проходимцы в море +8

09:44

Китайские дети, переставшие делать домашку сами, столкнулись с серьёзными трудностями на экзаменах +8

04:54

Шрифты, CDN и хостинг: трансграничная передача, которую никто не замечает +8

10:41

Как я писал расшифровщик записей, но в итоге получил бота для Яндекс.Телемост, с функциями которые даже не снились +7

10:30

Когда-то великие, но исчезнувшие бренды США +6

01:44

Делаем RAG-систему с нуля +5

09:15

Хотел сделать контроллер теплового насоса, а получился симулятор ESP32, Arduino и цепей 12/230 В +4

15:20

Почему «ничего не делать для GEO‑оптимизации» — нормальная стратегия GEO‑оптимизации контента +3

09:01

Часть 12. Приключения латинского алфавита в разных языках: почему польская и чешская латиницы такие разные? +59

18:01

Как фокусник‑математик из Стэнфордского университета обнаружил лазейку в казино +45

09:27

Прощай, Кинопоиск +39

07:05

Почему в ретроигры рубятся спустя сорок лет, а современные забываются через два-три года? +33

13:01

Винтажный электрофон Россия 321 Стерео +32

14:05

Инженерная тайна AMD из нулевых: что общего между Xbox 360, HTC HD2, Sony Ericsson Xperia Play и LG Optimus L2 +31

11:54

Edge‑навигация своими руками: ESP32 + Android + велосипед/мотоцикл +18

10:16

Чтобы понять Kubernetes, я написал свой Kubernetes +15

08:24

Дешево, но не точно: разбираем контроллер доверия к памяти LLM-агентов +15

12:31

Когда капитал перестанет ждать человека +13

11:39

Под кожей Войнича: новый слой 600-летней загадки +12

08:01

Большинство корпоративных ИТ-систем впервые размещается за пределами собственных дата-центров +11

07:00

Как мы перераспределили альфу в A/B-тестах и сократили размер выборки +10

10:30

Я ускорил запрос в 75 раз. Через две недели оказалось, что дело было не в запросе +9

21:06

18 изображений раскроют нам, как безмерно велик наш космос +7

12:16

Свинство в действии: расширяем синтаксис питона +7

07:44

МУзей Мусора МуМуКа +7

20:32

Мы как мир +6

17:23

«Вставьте диск в устройство A:» — я попробовал заставить Windows 11 сказать это SSD +6

13:59

Миллионы за комментарий. Почему IT‑гиганты скупают книги и корпоративную почту? +6

07:30

Запустили полнотекстовый и гибридный поиск в YDB: рассказываем, что под капотом +71

07:30

Запустили полнотекстовый и гибридный поиск в YDB: рассказываем, что под капотом +71

08:05

Первые отечественные электронные лифты. УЛЖМ МЯУ +57

11:50

Часы Unix тикали от розетки: откуда взялся 1970 год и что сломается в 2038-м +50

07:05

Технология будущего в 2003 году. Взлёт и падение IrDA +46

10:50

Что реально дает Wi-Fi 7 дома +38

13:01

Сложно о простом. Ничего не понимаю в ИБ. Часть 1. Зачем защищать корпоративную сеть, если она и так работает? +37

11:45

Найм уровня undefined +36

16:00

Как я создал СуперЗавуч — программу для генерации расписаний занятий +35

12:17

Prediction-Powered Smoothing как главный метод оценки качества современных нейросетей +34

09:01

Зелёный пайплайн ничего не доказывает. Семь способов, которыми quality gate пропускает брак в прод +34

06:28

Скоростная разработка электроники 2 +31

08:00

Разбор Jev — модели, которая не умеет писать +30

10:01

Я обучил нейросеть играть в «Точки» — теперь она меня обыгрывает +23

09:49

Я хотел одного гуля, а ИИ‑агенты собрали конвейер 3D‑персонажей для Unreal Engine 5 +23

06:43

C++: Айсберг времени жизни объектов +22

13:08

Когда одного CNI мало — deepdive в CNI Chaining +19

13:00

На чем гики из третьих стран учились программировать? +19

11:08

Прорыв GPT-6 Astra, Claude взрослеет до версии 5.5, скандал вокруг задачи Навье-Стокса: главные события в ИИ за сентябрь +19

12:35

Blackview Gamibook 16 — самый честный обзор на ноутбук за 160к с RTX5060 +17

СЕРВИСЫ
  • logo

    CloudLogs.ru - Облачное логирование

    • Храните логи вашего сервиса или приложения в облаке. Удобно просматривайте и анализируйте их.
ОБСУЖДАЕМОЕ

  • Прощай, Кинопоиск +39

    • 69

    Почему в ретроигры рубятся спустя сорок лет, а современные забываются через два-три года? +33

    • 65

    Что реально дает Wi-Fi 7 дома +38

    • 46

    Под кожей Войнича: новый слой 600-летней загадки +12

    • 36

    Я хотел одного гуля, а ИИ‑агенты собрали конвейер 3D‑персонажей для Unreal Engine 5 +23

    • 34

    Claude забанил: AI‑сервисы с подпиской, работающие из России +2

    • 33

    Скоростная разработка электроники 2 +31

    • 28

    Aquilum — быстрый аналог Obsidian на Rust, который потребляет около 27 МБ ОЗУ +15

    • 23

    Если у вас Android, жизнь стала чуточку легче +12

    • 23

    Как я создал СуперЗавуч — программу для генерации расписаний занятий +36

    • 22

    Я обучил нейросеть играть в «Точки» — теперь она меня обыгрывает +23

    • 21

    Технология будущего в 2003 году. Взлёт и падение IrDA +46

    • 21

    «Волчий билет» на один год за VPN на сервере — использовать все еще можно, а вот поднимать уже с ограничениями +11

    • 20

Подписка


  • Главная
  • Контакты
© 2026. Все публикации принадлежат авторам.