vLLM este un server de inferență de mare performanță, potrivit pentru a rula Hermes în producție. Expune un API compatibil OpenAI, așa că se integrează ușor cu multe aplicații.
Când alegi vLLM
vLLM este ideal când ai GPU și vrei throughput mare (multe cereri simultan), latență mică și un endpoint standard compatibil OpenAI. Este o alegere frecventă pentru servere de producție.
1. Instalează vLLM
pip install vllm
Ai nevoie de un mediu cu drivere GPU (CUDA) configurate.
2. Pornește serverul cu un model Hermes
python -m vllm.entrypoints.openai.api_server \
--model NousResearch/Hermes-3-Llama-3.1-8B \
--port 8000
vLLM descarcă greutățile modelului de pe Hugging Face și pornește un API pe portul 8000.
3. Apelează API-ul (stil OpenAI)
curl http://127.0.0.1:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "NousResearch/Hermes-3-Llama-3.1-8B",
"messages": [{"role":"user","content":"Salut!"}]
}'
4. Integrează-l cu alte aplicații
Pentru că endpointul este compatibil OpenAI, îl poți folosi direct în Open WebUI, Flowise sau n8n — setezi ca „base URL” adresa serverului vLLM și alegi modelul.
Notă: Pentru modele mari (70B, 405B) ai nevoie de mai multe GPU-uri; vLLM suportă distribuirea pe mai multe plăci video (tensor parallelism). Verifică VRAM-ul disponibil înainte de a alege dimensiunea.