🤖 ИИ

SGLang без магии: как устроены основные настройки инференса LLM

SGLang без магии: как устроены основные настройки инференса LLM
Фото: Хабр — ИИ

Когда LLM помещается на одной GPU и получает несколько запросов в минуту, настройка движка инференса обычно заканчивается на выборе модели и типа данных. Проблемы начинаются дальше: модель перестает помещаться в память, растет очередь запросов, длинные промпты съедают KV-кэш, а GPU простаивают в ожи…

Полный материал — на сайте первоисточника

Мы публикуем лишь краткий анонс. Все права на материал принадлежат Хабр — ИИ.

Читать на habr.com ↗

Ещё по теме

Зачем мы совместили съёмку на зелёном фоне, 3D-рендеры и генеративный ИИ в одном видео и что у нас получилось🤖
ИИ

Зачем мы совместили съёмку на зелёном фоне, 3D-рендеры и генеративный ИИ в одном видео и что у нас получилось

Использовать возможности нейросетей или организовать традиционную видеосъёмку? Рассказываем, как, получив задачу создать имиджевое видео, мы…

Хабр — ИИ