Servez des modèles ouverts à votre équipe et à vos applications depuis un seul serveur, sur une offre mensuelle fixe plutôt qu'au token.
*Hors TVA.
INCLUS DANS CHAQUE OFFRE
Ollama récupère des modèles ouverts et les sert derrière une API locale. Une seule commande fait tourner Llama, Qwen, Gemma, DeepSeek ou gpt-oss. L'endpoint sur le port 11434 parle le format OpenAI, donc la plupart du code client existant pointe dessus avec un simple changement d'URL. Le projet est sous licence MIT.
Open WebUI est l'interface de chat livrée dans le même modèle. Elle gère les connexions, l'envoi de documents pour le RAG et les permissions par groupe. Elle dialogue aussi avec n'importe quel backend compatible OpenAI, donc Ollama n'a pas à être la seule chose derrière. Faire tourner les deux sur votre propre VPS garde les prompts, les documents envoyés et les poids des modèles sur un disque que vous louez plutôt que sur celui d'un fournisseur.
Pointez LangChain ou votre propre client Python vers le port 11434 et ça marche.
Récupérez DeepSeek, Qwen, Gemma ou gpt-oss et passez de l'un à l'autre en quelques secondes.
Envoyez des documents, donnez un accès à chaque collègue et définissez ce qu'il peut atteindre.
Open WebUI donne à chacun un accès et une interface qu'ils comprennent déjà, pendant que le modèle tourne sur votre serveur. Rien n'est envoyé à un tiers pour de l'entraînement. C'est l'administrateur qui décide quels modèles chaque groupe peut atteindre.
Pointez LangChain, un service Python ou un plugin d'IDE vers l'API d'Ollama et changez l'URL de base. Le même code qui tournait chez un fournisseur commercial continue de fonctionner. La facture cesse de grimper avec l'usage.
Le choix du modèle est en réalité une question de mémoire. Les petits builds quantisés tiennent sans effort en RAM sur un serveur CPU. Les versions plus lourdes réclament de la vRAM avant d'être utilisables à vitesse de conversation. Commencez petit, mesurez, puis dimensionnez la machine selon le modèle que vous retenez.
L'image du conteneur garde le runtime séparé du reste de la machine, ce qui rend le verrouillage de version et les retours en arrière simples. Il tourne pareil sur un VPS classique ou sur un Docker VPS où le runtime est déjà installé.
Les agents et les workflows brûlent des tokens à toute vitesse, et c'est là qu'un serveur mensuel fixe commence à battre des appels API facturés à l'usage. Une instance n8n ou un agent OpenClaw peut appeler votre endpoint Ollama sur le même réseau privé.
L'inférence sur CPU convient aux petits modèles et cesse vite de convenir au-dessus. Un GPU VPS avec passthrough complet fait tourner les versions plus lourdes à vitesse de conversation. C'est le même compte, donc monter en gamme ne veut pas dire tout reconstruire.
Déployez n'importe quel template et des spécialistes certifiés couvrent tout au niveau du serveur, 24/7 et en plusieurs langues. C'est inclus dans chaque offre, affiné en 17 ans d'exploitation d'infrastructure.
Prototypez sur des cœurs EPYC avec un petit modèle quantisé, puis déplacez la même installation sur un GPU VPS quand elle réclame de la vRAM. Tout se trouve dans un seul compte et un seul tableau de bord, donc aucune migration à planifier.
Les fichiers de modèles se comptent en dizaines de gigaoctets et une bibliothèque sérieuse remplit un disque rapidement. Root complet sur KVM et stockage NVMe veut dire que c'est vous qui décidez ce qui est récupéré, ce qui est supprimé et avec quels runtime flags Ollama démarre.
Récupérer un modèle, c'est un gros téléchargement. Servir une API à une équipe, c'est un flux continu. Le trafic est illimité sur un port 1 Gbps, donc ni l'un ni l'autre n'apparaît en ligne sur la facture.
Les prompts et les documents envoyés vivent là où se trouve le serveur, ce qui compte davantage pour l'inférence que pour la plupart des choses que vous hébergeriez vous-même. Neuf emplacements en Europe, au Royaume-Uni et aux États-Unis veut dire que vous choisissez cela au moment de la commande.

Bon rapport qualité-prix
2025-12-29"J'utilise leurs services depuis un moment et c'est top. Les performances sont bonnes et fiables, et le prix rend le tout encore meilleur. Tout fonctionne sans accroc, et ils sont très réactifs dès qu'on a besoin de quelque chose."
Équipe et entreprise au top
2025-03-01"Équipe et entreprise au top. Au fur et à mesure qu'ils étendent la disponibilité de leurs services à d'autres régions du monde, ils continuent de progresser en qualité et en efficacité."
La mise en place a été rapide et...
2025-09-01"La mise en place a été rapide et le VPS tourne sans souci depuis. Le support client a répondu à mes questions sans compliquer les choses, et ça m'a honnêtement plu."
LumaDock propose un hébergement VPS, GPU et serveurs dédiés rapide et abordable pour les développeurs, les entreprises et les gamers, propulsé par du stockage NVMe et AMD EPYC.
LumaDock® est une marque déposée de LumaDock LTD, basée à Londres W1S 1HN, Royaume-Uni, et enregistrée en Angleterre et au pays de Galles sous le numéro de société 15844051.