Servește modele deschise echipei tale și aplicațiilor tale dintr-un singur server, cu un plan lunar fix în loc de plată pe token.
*TVA exclus.
INCLUS ÎN FIECARE PLAN
Ollama trage modele deschise și le servește în spatele unui API local. O singură comandă pornește Llama, Qwen, Gemma, DeepSeek sau gpt-oss. Endpointul de pe portul 11434 vorbește formatul OpenAI, așa că mai tot codul de client existent se îndreaptă spre el doar cu o schimbare de URL. Proiectul are licență MIT.
Open WebUI este interfața de chat care vine în același template. Se ocupă de autentificări, de încărcarea documentelor pentru RAG și de permisiunile pe grupuri. Vorbește și cu orice backend compatibil OpenAI, deci nu trebuie ca Ollama să fie singurul lucru din spate. Rulându-le pe amândouă pe propriul tău VPS, prompturile, documentele încărcate și greutățile modelelor rămân pe un disc pe care îl închiriezi tu, nu pe al vreunui furnizor.
Îndreaptă LangChain sau propriul tău client Python spre portul 11434 și merge.
Trage DeepSeek, Qwen, Gemma sau gpt-oss și comută între ele în câteva secunde.
Încarcă documente, dă-i fiecărui coleg un cont și stabilește la ce poate ajunge.
Open WebUI le dă tuturor un cont și o interfață pe care oricum o înțeleg deja, în timp ce modelul rulează pe serverul tău. Nu se trimite nimic către terți pentru antrenare. Administratorul decide la ce modele ajunge fiecare grup.
Îndreaptă LangChain, un serviciu în Python sau un plugin de IDE spre API-ul Ollama și schimbă base URL-ul. Același cod care rula pe un furnizor comercial merge mai departe. Iar factura încetează să mai crească odată cu utilizarea.
Alegerea modelului e de fapt o chestiune de memorie. Buildurile mici cuantizate încap lejer în RAM pe un server cu procesor. Versiunile mai mari vor vRAM înainte să fie utilizabile la viteză de conversație. Începe mic, măsoară, apoi dimensionează mașina după modelul la care rămâi.
Imaginea de container ține runtime-ul separat de tot restul de pe mașină, ceea ce face simplă fixarea versiunilor și revenirea. Rulează la fel pe un VPS obișnuit sau pe un Docker VPS cu runtime deja instalat.
Agenții și workflow-urile ard tokeni rapid, iar aici începe un server lunar fix să bată apelurile de API taxate la consum. O instanță n8n sau un agent OpenClaw poate apela endpointul tău Ollama în aceeași rețea privată.
Inferența pe procesor e în regulă pentru modele mici și încetează repede să mai fie în regulă peste asta. Un GPU VPS cu passthrough complet duce versiunile mai mari la viteză de conversație. E același cont, așa că urcarea nu înseamnă că reconstruiești ceva.
Implementează orice șablon, iar specialiști certificați acoperă totul la nivel de server, 24/7 și în mai multe limbi. Este inclus în fiecare plan, șlefuit în 17 ani de administrare a infrastructurii.
Fă prototipul pe nuclee EPYC cu un model mic cuantizat, apoi mută aceeași configurație pe un GPU VPS când are nevoie de vRAM adevărat. Totul stă într-un singur cont și într-un singur panou, așa că nu ai nicio migrare de programat.
Fișierele de model ajung la zeci de gigabytes, iar o bibliotecă serioasă umple un disc cât ai clipi. Root complet pe KVM plus stocare NVMe înseamnă că tu decizi ce se trage, ce se șterge și cu ce runtime flags pornește Ollama.
Tragerea unui model e o descărcare mare. Servirea unui API către o echipă e un flux constant. Traficul este nelimitat pe un port de 1 Gbps, așa că niciuna dintre ele nu apare ca linie pe factură.
Prompturile și documentele încărcate stau acolo unde e serverul, iar la inferență asta contează mai mult decât la majoritatea lucrurilor pe care le-ai găzdui singur. Nouă locații în Europa, Marea Britanie și SUA înseamnă că alegi asta direct în pagina de comandă.

Preț bun pentru ce primești
2025-12-29"Le folosesc serviciile de ceva vreme și am fost foarte mulțumit. Performanța e bună și de încredere, iar prețul face totul și mai atractiv. Toate merg lin și răspund rapid când ai nevoie de ceva."
Echipă și companie extraordinare
2025-03-01"Echipă și companie extraordinare. Pe măsură ce extind disponibilitatea serviciilor în alte regiuni ale lumii, cresc și mai mult în calitate și eficiență."
Setarea a fost rapidă și...
2025-09-01"Setarea a fost rapidă, iar VPS-ul merge fără probleme de atunci. Echipa de suport mi-a răspuns la întrebări fără să complice lucrurile, iar sincer mi-a plăcut asta."
LumaDock oferă găzduire VPS, GPU și servere dedicate rapidă și accesibilă pentru dezvoltatori, companii și gameri, bazată pe stocare NVMe și AMD EPYC.
LumaDock® este o marcă înregistrată a LumaDock LTD, cu sediul în Londra W1S 1HN, Regatul Unit, și înregistrată în Anglia și Țara Galilor sub numărul de companie 15844051.