Dep. Comercial +40 365-882.777 +40 722-241.273 Lun-Vin: 10:00-18:00
View Categories

Cum rulez Hermes cu vLLM (server API compatibil OpenAI)?

< 1 minut de citit

vLLM este un server de inferență de mare performanță, potrivit pentru a rula Hermes în producție. Expune un API compatibil OpenAI, așa că se integrează ușor cu multe aplicații.

Când alegi vLLM

vLLM este ideal când ai GPU și vrei throughput mare (multe cereri simultan), latență mică și un endpoint standard compatibil OpenAI. Este o alegere frecventă pentru servere de producție.

1. Instalează vLLM

pip install vllm

Ai nevoie de un mediu cu drivere GPU (CUDA) configurate.

2. Pornește serverul cu un model Hermes

python -m vllm.entrypoints.openai.api_server \
  --model NousResearch/Hermes-3-Llama-3.1-8B \
  --port 8000

vLLM descarcă greutățile modelului de pe Hugging Face și pornește un API pe portul 8000.

3. Apelează API-ul (stil OpenAI)

curl http://127.0.0.1:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "NousResearch/Hermes-3-Llama-3.1-8B",
    "messages": [{"role":"user","content":"Salut!"}]
  }'

4. Integrează-l cu alte aplicații

Pentru că endpointul este compatibil OpenAI, îl poți folosi direct în Open WebUI, Flowise sau n8n — setezi ca „base URL” adresa serverului vLLM și alegi modelul.

Notă: Pentru modele mari (70B, 405B) ai nevoie de mai multe GPU-uri; vLLM suportă distribuirea pe mai multe plăci video (tensor parallelism). Verifică VRAM-ul disponibil înainte de a alege dimensiunea.

Actualizat la 04/08/2026