Crear, alojar y operar soluciones de IA.
Sirva LLM de código abierto desde su VPS — API compatible con OpenAI, sin coste por token.
Ollama es un motor de inferencia de código abierto que descarga y sirve grandes modelos de lenguaje — Llama 3, Mistral, Qwen, DeepSeek, Gemma — en su propia infraestructura, con un solo comando. Expone una API REST compatible con OpenAI: cualquier herramienta o biblioteca que sepa hablar con OpenAI habla con su instancia autoalojada sin que cambie una sola línea de código. Lo que lo distingue de los otros dos componentes de inferencia del catálogo tiene que ver con su alcance: Ollama hace una sola cosa, servir modelos de texto, y la vuelve trivial — la gestión de los modelos se reduce a `ollama pull`, `ollama list` y `ollama rm`, sobre una biblioteca de más de un centenar de modelos listos para usar. LocalAI abarca más y añade imágenes, transcripción y embeddings desde el mismo contenedor; LiteLLM, por su parte, no calcula nada: es una pasarela que enruta hacia Ollama y hacia proveedores remotos.
Desplegado en un VPS ServOrbit, Ollama se convierte en su motor de inferencia privado: peticiones ilimitadas a un coste mensual fijo, con prompts y respuestas que nunca salen de su servidor. Ollama no tiene ni interfaz web ni autenticación: por eso su puerto nunca se publica tras un dominio y permanece ligado al bucle local de la máquina — el código que se ejecuta en ese mismo VPS llama a `http://127.0.0.1:11434`, y desde otra máquina hace falta un túnel SSH. Ollama no tiene ni interfaz web ni autenticación: asócielo a Open WebUI para disponer de una interfaz de conversación, a LiteLLM para añadir claves y cuotas, o a n8n y Flowise para la automatización.
ollama pull llama3.1:8b, ollama list, ollama rmSustituya sus llamadas a la API de OpenAI por su propio punto de entrada Ollama. Una aplicación alojada en el mismo VPS llama a http://127.0.0.1:11434/v1: sus prompts nunca salen de la máquina, lo que conviene al tratamiento de contratos, de documentos internos o de cualquier dato sensible.
Haga funcionar un modelo de 7 o 13 mil millones de parámetros en un VPS dedicado para prototipar sus funciones de IA antes de conectar un LLM de producción. El coste es fijo, sin facturas sorpresa, y un ollama rm deja la máquina a cero.
Asocie Ollama a Open WebUI para dar a todo su equipo una interfaz de conversación compartida, alimentada por modelos de código abierto, sobre una infraestructura que usted controla.
Guía optimizada para los VPS Cloud ServOrbit.
Pida un VPS ServOrbit con al menos 8 GB de RAM para un modelo de 7 a 8 mil millones de parámetros cuantizado en Q4 sobre procesador, y 16 GB para modelos más grandes. El sistema instalado es Ubuntu 24.04. Para tiempos de respuesta dignos de la producción, un servidor dotado de una GPU cambia notablemente la experiencia.
La instalación desde su área de cliente crea el contenedor ollama/ollama, monta el volumen ollama en /root/.ollama para que los modelos sobrevivan a los reinicios, y publica el servicio en el bucle local, en 127.0.0.1:11434. Nada queda expuesto a Internet en esta etapa: es algo deliberado, ya que Ollama no tiene ninguna autenticación.
Ollama no tiene pantalla de inicio de sesión: es una API HTTP acompañada de una línea de comandos. Por SSH en el VPS, ejecute docker exec -it ollama ollama pull llama3 y luego docker exec -it ollama ollama run llama3. Conecte después una interfaz, Open WebUI por ejemplo, en lugar de exponer la API tal cual.
Descargue un modelo con docker exec -it ollama ollama pull llama3.1:8b, compruebe que ha quedado registrado con docker exec -it ollama ollama list y luego pruebe desde el VPS: curl http://127.0.0.1:11434/api/generate -d '{"model":"llama3.1:8b","prompt":"Hola"}'.
Ollama no pide ningún identificador y desconoce la noción de clave de API: cualquiera que alcance el servicio puede consultar sus modelos y descargar otros. Por eso ServOrbit no le vincula ningún dominio — el cifrado de un vhost protegería el transporte, no identificaría a nadie. Dos usos se sostienen: trabajar mediante un túnel SSH, o colocar delante de Ollama una pasarela que autentique, LiteLLM por ejemplo, y publicar únicamente esta.
En Open WebUI, en Settings y luego Connections, indique http://localhost:11434. Desde un SDK de OpenAI que se ejecute en el propio VPS, configure base_url='http://127.0.0.1:11434/v1' y api_key='ollama'. Desde otra máquina no existe ningún punto de entrada público: abra un túnel SSH con ssh -L 11434:127.0.0.1:11434 root@<ip-del-vps> y luego apunte a http://localhost:11434/v1. El puerto puede reasignarse en la instalación: use el que se muestra en la ficha de la aplicación en su área de cliente, ya que 11434 es solo el valor del catálogo.
¿Mantiene un proyecto que utiliza Ollama? Este botón permite a sus lectores desplegarlo en un VPS con un clic, sin leer documentación de Docker.
[](https://servorbit.com/vps-cloud?template=ollama&utm_source=deploy-badge&utm_medium=referral&utm_campaign=ollama)<a href="https://servorbit.com/vps-cloud?template=ollama&utm_source=deploy-badge&utm_medium=referral&utm_campaign=ollama"><img src="https://servorbit.com/brand/deploy/button.svg" alt="Deploy Ollama on ServOrbit" height="40"></a>El botón lleva al pedido de un VPS con la plantilla preseleccionada. La imagen se sirve desde servorbit.com: no tiene que alojar nada por su parte.
Interfaz web para interactuar con sus LLM locales o remotos. Sus datos permanecen en su infraestructura — ningún tercero implicado.
Automatización y flujos de trabajoConstruya pipelines de automatización LLM con drag-and-drop. Cadenas LangChain visuales, conectadas a sus herramientas existentes.
Automatización y flujos de trabajoAutomatice sus flujos de trabajo entre aplicaciones sin código. Más de 400 integraciones, 100 % autoalojado en su VPS.
Consulte nuestro centro de ayuda y nuestra FAQ, o contacte con nuestro equipo: llamada, WhatsApp o correo electrónico. Soporte en francés, inglés y árabe.
Escribir por WhatsAppse abre en una pestaña nueva