Flowise poate folosi modele rulate local, nu doar servicii comerciale. Cea mai simplă cale este prin Ollama, un server ușor pentru modele open-source. Această variantă îți garantează ca datele nu părăsesc serverul tău și nu plătești per token.
1. Instalează Ollama
Pe VPS (Linux):
curl -fsSL https://ollama.com/install.sh | sh
Descarcă apoi un model, de exemplu:
ollama pull llama3.1
ollama pull nous-hermes2
Ollama expune un server local pe portul 11434.
2. Asigură conectivitatea Flowise → Ollama
Dacă Flowise rulează în Docker, containerul trebuie să poată accesa Ollama. Folosește adresa corectă (de exemplu http://host.docker.internal:11434 sau IP-ul gazdei) și asigură-te că Ollama ascultă pe interfața potrivită.
3. Adaugă nodul ChatOllama
Pe pânză, adaugă nodul ChatOllama. Completează:
- Base URL — adresa serverului Ollama (de exemplu
http://127.0.0.1:11434). - Model Name — numele modelului descărcat (de exemplu
llama3.1).
4. Pentru embeddings locale
Pentru RAG fără costuri externe, folosește nodul Ollama Embeddings cu un model de embeddings (de exemplu nomic-embed-text).
5. Testează
Deschide chat-ul și trimite un mesaj. Primul răspuns poate fi mai lent (modelul se încarcă în memorie). Pentru performanță bună, alege dimensiunea modelului în funcție de RAM/VRAM disponibil pe VPS.
Notă: Modelele mari cer mult RAM/VRAM. Pentru un VPS fără GPU, alege modele mici/cuantizate. Un plan VPS mai puternic (sau cu GPU) oferă răspunsuri mai rapide.