Ollama este cea mai simplă cale de a rula un model precum Hermes pe propriul server, printr-o singură comandă. Iată pașii.
1. Instalează Ollama
Pe VPS (Linux):
curl -fsSL https://ollama.com/install.sh | sh
Ollama pornește un server local pe portul 11434.
2. Descarcă un model Hermes
Caută modelul dorit în biblioteca Ollama și descarcă-l, de exemplu:
ollama pull hermes3
# sau o variantă anume, de exemplu:
ollama pull hermes3:8b
Numele exact al modelului/variantei îl verifici în biblioteca Ollama.
3. Pornește o conversație
ollama run hermes3
Scrie un mesaj direct în terminal ca să testezi modelul.
4. Folosește-l prin API
Ollama expune un API local pe care îl pot folosi alte aplicații (Open WebUI, Flowise, n8n):
curl http://127.0.0.1:11434/api/generate -d '{
"model": "hermes3",
"prompt": "Salut! Cine ești?"
}'
5. Alege varianta potrivită hardware-ului
Dacă modelul e prea lent sau nu încape în memorie, alege o variantă mai mică sau mai puternic cuantizată (de exemplu 8B în loc de 70B).
Sfat: Primul răspuns poate fi mai lent (modelul se încarcă în memorie). Pentru viteză bună, rulează pe un server cu GPU sau cu RAM generos.