Dep. Comercial +40 365-882.777 +40 722-241.273 Lun-Vin: 10:00-18:00
View Categories

Cerințe hardware și cuantizare pentru Ollama

1 minut de citit

O frecventă întrebare privitoare la Ollama este legată de hardware-ul necesar. Răspunsul depinde de dimensiunea modelului și de cuantizare.

Regula de bază

Un model trebuie să încapă în memorie (RAM sau, ideal, VRAM). Cu cât are mai mulți parametri, cu atât cere mai multă memorie; cuantizarea reduce acest necesar.

Orientativ

  • Modele ~3B-8B — rulează pe CPU cu ~8-16 GB RAM sau pe un GPU modest; cuantizate (Q4), cer ~4-6 GB.
  • Modele ~13B — confortabil cu un GPU cu ~8-12 GB VRAM.
  • Modele ~70B — necesită zeci de GB VRAM (GPU-uri puternice sau mai multe).

GPU vs CPU

Ollama detectează automat GPU-urile compatibile (NVIDIA/AMD; pe Mac folosește Metal). Cu GPU, răspunsurile sunt mult mai rapide. Fără GPU, rulează pe CPU — acceptabil pentru modele mici, lent pentru cele mari.

Cuantizarea

Modelele vin în variante cuantizate (Q4, Q5, Q8). Q4_K_M este un compromis excelent: consum mic de memorie, calitate bună. Alege cuantizări mai mari (Q5/Q8) doar dacă ai resurse și vrei precizie maximă.

Reglaje utile

  • OLLAMA_KEEP_ALIVE — cât timp rămâne modelul în memorie după utilizare (evită reîncărcarea).
  • num_ctx — fereastra de context; una mai mare consumă mai multă memorie.

Sfat: Pe un VPS fără GPU, rămâi la modele mici cuantizate. Pentru modele medii/mari sau mulți utilizatori, alege un plan cu GPU. La HostX poți rula Ollama pe planuri VPS cu control complet.

Actualizat la 05/08/2026