Sirva modelos abertos para o seu time e para os seus aplicativos a partir de um só servidor, num plano mensal fixo em vez de pagar por token.
*ICMS não incluído.
INCLUÍDO EM CADA PLANO
O Ollama puxa modelos abertos e serve eles atrás de uma API local. Um único comando põe o Llama, o Qwen, o Gemma, o DeepSeek ou o gpt-oss para rodar. O endpoint na porta 11434 fala o formato OpenAI, então a maior parte do código de cliente já existente aponta para lá só com uma troca de URL. O projeto tem licença MIT.
O Open WebUI é a interface de chat que vem no mesmo template. Ele cuida dos logins, do upload de documentos para RAG e das permissões por grupo. Também conversa com qualquer backend compatível com OpenAI, então o Ollama não precisa ser a única coisa por trás. Rodar os dois no seu próprio VPS mantém os prompts, os documentos enviados e os pesos dos modelos num disco que você aluga em vez de um de um fornecedor.
Aponte o LangChain ou o seu próprio cliente Python para a porta 11434 e funciona.
Puxe o DeepSeek, o Qwen, o Gemma ou o gpt-oss e alterne entre eles em segundos.
Envie documentos, dê um login para cada colega e defina até onde cada um chega.
O Open WebUI dá a todo mundo um login e uma interface que eles já entendem, enquanto o modelo roda no seu servidor. Nada é enviado para terceiros treinarem em cima. É o administrador que decide a quais modelos cada grupo chega.
Aponte o LangChain, um serviço em Python ou um plugin da IDE para a API do Ollama e troque a base URL. O mesmo código que rodava contra um fornecedor comercial continua funcionando. A fatura para de crescer junto com o uso.
A escolha do modelo é, na real, uma questão de memória. As builds pequenas quantizadas cabem tranquilas na RAM de um servidor com CPU. As versões maiores querem vRAM antes de ficarem usáveis em velocidade de conversa. Comece pequeno, meça e depois dimensione a máquina para o modelo em que você parar.
A imagem do container mantém o runtime separado de todo o resto da máquina, o que deixa simples fixar versões e voltar atrás. Roda igual em um VPS comum ou em um Docker VPS com o runtime já instalado.
Agentes e workflows queimam tokens rápido, e é aí que um servidor mensal fixo começa a ganhar das chamadas de API medidas. Uma instância n8n ou um agente OpenClaw pode chamar o seu endpoint do Ollama na mesma rede privada.
A inferência em CPU dá conta de modelos pequenos e rapidamente deixa de dar conta acima disso. Um GPU VPS com passthrough completo roda as versões maiores em velocidade de conversa. É a mesma conta, então subir não significa reconstruir nada.
Implante qualquer template e especialistas certificados cobrem tudo no nível do servidor, 24/7 e em vários idiomas. Está incluído em cada plano, aperfeiçoado ao longo de 17 anos gerindo infraestrutura.
Prototipe em cores EPYC com um modelo pequeno quantizado e depois mova a mesma configuração para um GPU VPS quando precisar de vRAM de verdade. Está tudo em uma conta e um painel, então não há migração para agendar.
Os arquivos de modelo chegam a dezenas de gigabytes e uma biblioteca séria enche um disco num instante. Root completo em KVM mais armazenamento NVMe significa que é você que decide o que é puxado, o que é apagado e com quais runtime flags o Ollama sobe.
Puxar um modelo é um download grande. Servir uma API para um time é um fluxo constante. O tráfego é ilimitado em uma porta de 1 Gbps, então nenhum dos dois aparece como linha na fatura.
Os prompts e os documentos enviados moram onde o servidor está, e isso pesa mais na inferência do que na maioria das coisas que você hospedaria por conta própria. Nove localizações na Europa, no Reino Unido e nos EUA significa que você escolhe isso já na página do pedido.

Bom preço pelo que entrega
2025-12-29"Uso os serviços deles há um tempo e tem sido ótimo. O desempenho é bom e confiável, e o preço torna tudo ainda melhor. Tudo funciona de forma tranquila, e eles são muito ágeis quando você precisa de alguma coisa."
Time e empresa incríveis
2025-03-01"Time e empresa incríveis. Conforme vão expandindo a disponibilidade dos serviços para outras regiões do mundo, continuam elevando o nível de excelência e eficiência."
A configuração foi rápida e o...
2025-09-01"A configuração foi rápida e o VPS vem rodando tranquilo desde então. O suporte respondeu minhas dúvidas sem complicar as coisas, e sinceramente gostei disso."
A LumaDock oferece hospedagem VPS, GPU e servidores dedicados rápida e acessível para desenvolvedores, empresas e gamers, com armazenamento NVMe e AMD EPYC.
LumaDock® é uma marca registrada da LumaDock LTD, sediada em Londres W1S 1HN, Reino Unido, e registrada na Inglaterra e no País de Gales sob o número de empresa 15844051.