Что такое vLLM Опубликовано:
|
|
VLLM —
простыми словами
|
библиотека и сервер с открытым кодом для быстрого инференса больших языковых моделей (LLM) на GPU. vLLM создана для сценариев, где модель одновременно обслуживает много запросов — чат-боты, API-сервисы, внутренние ассистенты компании. Проект появился в 2023 году в исследовательской группе UC Berkeley. Ключевая идея — алгоритм PagedAttention, который управляет памятью видеокарты постранично, как операционная система управляет оперативной памятью процесса. За счет этого GPU меньше простаивает, а один сервер обслуживает заметно больше параллельных запросов, чем при наивном инференсе. Второй важный механизм — continuous batching. Новые запросы добавляются в батч на лету, не дожидаясь завершения уже идущей генерации. Это отличает vLLM от простых оберток вокруг модели, где батч формируется один раз и не меняется до конца обработки. Установка vLLMvLLM написан на Python и ставится через pip: pip install vllm Для работы нужна видеокарта NVIDIA с CUDA — библиотека рассчитана в первую очередь на серверный GPU-инференс. Есть и готовый образ Docker, его удобно использовать, если не хочется настраивать окружение Python вручную. * если ставите на голую машину, а не через Docker — версии CUDA Toolkit, драйвера NVIDIA и PyTorch должны совпадать друг с другом и с требованиями конкретной версии vLLM. При рассинхроне сборка падает или уходит в компиляцию из исходников. Docker-образ эту проблему снимает полностью. vLLM как пользоватьсяСервер с OpenAI-совместимым API запускается одной командой: vllm serve meta-llama/Llama-3.1-8B-Instruct После запуска мы получаем HTTP-сервер, к которому можно обращаться так же, как к API OpenAI — достаточно поменять адрес эндпоинта в клиенте. Это упрощает миграцию проектов, изначально написанных под облачные модели. Возможности vLLM
Vllm-WindowsНативной поддержки Windows у vLLM нет — в официальной документации в списке платформ Windows отсутствует. Рабочих путей запуска на Windows три:
vLLM или OllamaОба инструмента запускают LLM локально или на сервере, но решают разные задачи:
vLLM распространяется под лицензией Apache 2.0. Актуальный список поддерживаемых моделей, GPU и форматов квантования стоит смотреть в официальной документации проекта — она обновляется быстрее, чем любая статья на эту тему. Задать вопрос в телеграм-чате |
Другие термины
SMTP
Git
Чипсет
Кодек
Свитч
Docker
Дистрибутив
Grafana Loki
Материнская плата
PowerDNS
Corosync
PHP-FPM
Термопаста
Procmail
Podman
SOCKS
Cron
Rocky Linux
Вайб-кодинг
Кэш
.....
Опубликовано: