Роздавай відкриті моделі своїй команді та своїм застосункам з одного сервера, за фіксованим місячним планом, а не за кожен token.
*Без ПДВ.
ВХОДИТЬ У КОЖЕН ПЛАН
Ollama підтягує відкриті моделі й віддає їх за локальним API. Однієї команди досить, щоб запустити Llama, Qwen, Gemma, DeepSeek чи gpt-oss. Endpoint на порту 11434 говорить форматом OpenAI, тож більшість наявного клієнтського коду спрямовується на нього простою зміною URL. Проєкт має ліцензію MIT.
Open WebUI — це чат інтерфейс, який іде в тому самому шаблоні. Він бере на себе входи, завантаження документів для RAG і права для кожної групи. Ще він говорить з будь-яким OpenAI сумісним backend, тож за ним не обов'язково має стояти саме Ollama. Коли ти запускаєш обидва на власному VPS, prompts, завантажені документи й ваги моделей лишаються на диску, який орендуєш ти, а не якийсь вендор.
Спрямуй LangChain або власний клієнт на Python на порт 11434, і воно працює.
Завантаж DeepSeek, Qwen, Gemma чи gpt-oss і перемикайся між ними за секунди.
Завантажуй документи, дай кожному колезі вхід і визнач, до чого він має доступ.
Open WebUI дає кожному вхід і інтерфейс, який усі й так розуміють, а модель працює на твоєму сервері. Нічого не йде третій стороні на тренування. Адміністратор вирішує, до яких моделей дістанеться кожна група.
Спрямуй LangChain, сервіс на Python чи плагін в IDE на API Ollama і поміняй base URL. Той самий код, який працював з комерційним провайдером, працює далі. А рахунок перестає рости разом з використанням.
Вибір моделі — це насправді питання пам'яті. Малі квантовані збірки спокійно вміщаються в RAM на сервері з CPU. Більші релізи хочуть vRAM, перш ніж стануть придатними на швидкості розмови. Почни з малого, виміряй, а потім підбирай машину під ту модель, на якій зупинишся.
Образ контейнера тримає runtime окремо від усього іншого на машині, завдяки чому фіксація версій і відкати робляться просто. Він працює однаково на звичайному VPS і на Docker VPS із уже встановленим runtime.
Агенти та workflows спалюють tokens дуже швидко, і саме тут фіксований місячний сервер починає вигравати в тарифікованих викликів API. Інстанс n8n чи агент OpenClaw може звертатися до твого endpoint Ollama у тій самій приватній мережі.
Inference на CPU цілком годиться для малих моделей і дуже швидко перестає годитися вище. GPU VPS з повним passthrough тягне більші релізи на швидкості розмови. Це той самий обліковий запис, тож перехід вище не означає, що треба щось перебудовувати.
Розгортай будь-який шаблон, а сертифіковані фахівці покривають усе на рівні сервера, 24/7 і кількома мовами. Це входить у кожен план, відточене за 17 років роботи з інфраструктурою.
Зроби прототип на ядрах EPYC з маленькою квантованою моделлю, а потім перенеси ту саму конфігурацію на GPU VPS, коли їй знадобиться справжня vRAM. Усе лежить в одному обліковому записі та одній панелі, тож жодної міграції планувати не треба.
Файли моделей сягають десятків гігабайтів, а серйозна бібліотека заповнює диск дуже швидко. Повний root на KVM плюс сховище NVMe означає, що саме ти вирішуєш, що завантажити, що прибрати і з якими runtime flags стартує Ollama.
Завантажити модель — це велике скачування. Роздавати API команді — це рівний постійний потік. Трафік безлімітний на порту 1 Gbps, тож жодне з цього не з'явиться рядком у рахунку.
Prompts і завантажені документи живуть там, де стоїть сервер, і для inference це важить більше, ніж для більшості речей, які ти розгортав би сам. Дев'ять локацій у Європі, Великій Британії та США означають, що ти обираєш це просто на сторінці замовлення.

Хороша ціна за те, що отримуєш
2025-12-29"Користуюсь їхніми послугами вже якийсь час і все чудово. Продуктивність хороша і надійна, а ціна робить все ще привабливішим. Все просто працює як треба, і вони швидко реагують, коли щось потрібно."
Чудова команда і компанія
2025-03-01"Чудова команда і компанія. Поступово розширюючи доступність послуг у нові регіони світу, вони продовжують піднімати планку якості та ефективності."
Налаштування було швидким і...
2025-09-01"Налаштування було швидким, і VPS з того часу працює без проблем. Служба підтримки відповіла на мої запитання, не ускладнюючи нічого зайвим, і це мені справді сподобалось."
LumaDock пропонує швидкий і доступний VPS, GPU та dedicated server hosting для розробників, бізнесу й геймерів на базі NVMe-сховища та AMD EPYC.
LumaDock® є зареєстрованою торговельною маркою компанії LumaDock LTD, що базується в Лондоні W1S 1HN, Велика Британія, та зареєстрована в Англії та Уельсі під номером компанії 15844051.