Serveer open modellen aan je team en je apps vanaf één server, op een vast maandbedrag in plaats van per token.
*Exclusief btw.
INBEGREPEN BIJ ELK PLAN
Ollama haalt open modellen binnen en serveert ze achter een lokale API. Eén commando krijgt Llama, Qwen, Gemma, DeepSeek of gpt-oss draaiend. Het endpoint op poort 11434 spreekt het OpenAI formaat, dus de meeste bestaande clientcode wijst er met een andere URL gewoon naartoe. Het project is MIT gelicentieerd.
Open WebUI is de chatinterface die in dezelfde template meekomt. Het regelt logins, documentupload voor RAG en rechten per groep. Het praat ook met elke OpenAI compatibele backend, dus Ollama hoeft niet het enige te zijn dat erachter zit. Beide op je eigen VPS draaien houdt de prompts, de geüploade documenten en de modelgewichten op een schijf die jij huurt in plaats van die van een leverancier.
Wijs LangChain of je eigen Python client naar poort 11434 en het werkt.
Haal DeepSeek, Qwen, Gemma of gpt-oss binnen en wissel er binnen seconden tussen.
Upload documenten, geef elke collega een login en bepaal waar ze bij kunnen.
Open WebUI geeft iedereen een login en een interface die ze al kennen, terwijl het model op jouw server draait. Er gaat niets naar een derde partij om mee te trainen. De beheerder bepaalt welke modellen elke groep mag bereiken.
Wijs LangChain, een Python service of een IDE plugin naar de Ollama API en wissel de base URL om. Dezelfde code die tegen een commerciële provider draaide blijft werken. De rekening groeit niet langer mee met het gebruik.
Modelkeuze is eigenlijk een geheugenvraag. Kleine gekwantiseerde builds passen comfortabel in het RAM van een CPU server. Grotere releases willen vRAM voordat ze bruikbaar zijn op gespreksnelheid. Begin klein, meet en stem de machine daarna af op het model waar je bij blijft.
De container image houdt de runtime gescheiden van al het andere op de machine, wat versies vastzetten en terugrollen eenvoudig maakt. Het draait hetzelfde op een gewone VPS of op een Docker VPS waar de runtime al staat.
Agents en workflows verbranden tokens in rap tempo, en dat is precies waar een vaste maandelijkse server metered API calls begint te verslaan. Een n8n instantie of een OpenClaw agent kan je Ollama endpoint aanroepen op hetzelfde privénetwerk.
Inference op CPU is prima voor kleine modellen en houdt daarboven snel op prima te zijn. Een GPU VPS met volledige passthrough draait de grotere releases op gespreksnelheid. Het is hetzelfde account, dus opschalen betekent niet dat je iets opnieuw moet bouwen.
Deploy elke template en gecertificeerde specialisten dekken alles op serverniveau, 24/7 en in meerdere talen. Het is inbegrepen bij elk plan, verfijnd in 17 jaar infrastructuur draaien.
Prototype op EPYC cores met een klein gekwantiseerd model en verplaats dezelfde opstelling naar een GPU VPS zodra er echt vRAM nodig is. Alles zit in één account en één dashboard, dus er valt geen migratie in te plannen.
Modelbestanden lopen op tot tientallen gigabytes en een serieuze bibliotheek vult een schijf snel. Volledige root op KVM plus NVMe opslag betekent dat jij bepaalt wat er binnengehaald wordt, wat eruit gaat en met welke runtime flags Ollama start.
Een model binnenhalen is een flinke download. Een API aan een team serveren is een gestage stroom. Verkeer is ongelimiteerd op een 1 Gbps poort, dus geen van beide verschijnt als regel op de factuur.
Prompts en geüploade documenten wonen waar de server woont, en dat weegt bij inference zwaarder dan bij de meeste dingen die je zelf host. Negen locaties in Europa, het VK en de VS betekent dat je die keuze op de bestelpagina maakt.

Goede prijs voor wat je krijgt
2025-12-29"Ik gebruik hun dienst al een tijdje en het bevalt prima. De performance is goed en betrouwbaar, en de prijs maakt het nog beter. Alles loopt gewoon soepel, en ze reageren snel als je iets nodig hebt."
Geweldig team en bedrijf
2025-03-01"Geweldig team en bedrijf. Terwijl ze hun diensten naar meer regio's van de wereld uitbreiden, blijven ze bouwen aan kwaliteit en efficiëntie."
Setup was snel en de...
2025-09-01"Setup was snel en de VPS draait sindsdien soepel. De klantenservice beantwoordde mijn vragen zonder er moeilijk over te doen, wat ik eerlijk gezegd fijn vond."
LumaDock biedt snelle en betaalbare VPS, GPU en dedicated server hosting voor developers, bedrijven en gamers, aangedreven door NVMe-opslag en AMD EPYC.
LumaDock® is een geregistreerd handelsmerk van LumaDock LTD, gevestigd in Londen W1S 1HN, Verenigd Koninkrijk, en geregistreerd in Engeland en Wales onder bedrijfsnummer 15844051.