Crear, alojar y operar soluciones de IA.

Logo de Ollama

Ollama

Sirva LLM de código abierto desde su VPS — API compatible con OpenAI, sin coste por token.

8 GB mínimo (16 GB recomendado) RAM 2 vCPU Puerto 11434 Disponible

Stack técnico

DockerGollama.cpp
RAM mínima8 GB mínimo (16 GB recomendado)
CPU mínima2 vCPU
Puerto por defecto11434
SO compatiblesubuntu-24.04

Ollama es un motor de inferencia de código abierto que descarga y sirve grandes modelos de lenguaje — Llama 3, Mistral, Qwen, DeepSeek, Gemma — en su propia infraestructura, con un solo comando. Expone una API REST compatible con OpenAI: cualquier herramienta o biblioteca que sepa hablar con OpenAI habla con su instancia autoalojada sin que cambie una sola línea de código. Lo que lo distingue de los otros dos componentes de inferencia del catálogo tiene que ver con su alcance: Ollama hace una sola cosa, servir modelos de texto, y la vuelve trivial — la gestión de los modelos se reduce a `ollama pull`, `ollama list` y `ollama rm`, sobre una biblioteca de más de un centenar de modelos listos para usar. LocalAI abarca más y añade imágenes, transcripción y embeddings desde el mismo contenedor; LiteLLM, por su parte, no calcula nada: es una pasarela que enruta hacia Ollama y hacia proveedores remotos.

Desplegado en un VPS ServOrbit, Ollama se convierte en su motor de inferencia privado: peticiones ilimitadas a un coste mensual fijo, con prompts y respuestas que nunca salen de su servidor. Ollama no tiene ni interfaz web ni autenticación: por eso su puerto nunca se publica tras un dominio y permanece ligado al bucle local de la máquina — el código que se ejecuta en ese mismo VPS llama a `http://127.0.0.1:11434`, y desde otra máquina hace falta un túnel SSH. Ollama no tiene ni interfaz web ni autenticación: asócielo a Open WebUI para disponer de una interfaz de conversación, a LiteLLM para añadir claves y cuotas, o a n8n y Flowise para la automatización.

Funcionalidades clave

API compatible con OpenAI — cambie la URL base y su código existente funciona de inmediato
Gestión de los modelos con un solo comando: ollama pull llama3.1:8b, ollama list, ollama rm
Llama 3, Mistral, Qwen, DeepSeek, Gemma, Phi y más de un centenar de modelos adicionales
Funciona sin tarjeta gráfica; el paso a una GPU acelera notablemente la inferencia cuando la máquina dispone de una
Servidor multimodelo: varios modelos cargados en paralelo, cada uno con su propio contexto
Modelos conservados en un volumen Docker — sobreviven al reinicio del contenedor

¿Cuándo usar esta solución?

1

Motor de inferencia privado

Sustituya sus llamadas a la API de OpenAI por su propio punto de entrada Ollama. Una aplicación alojada en el mismo VPS llama a http://127.0.0.1:11434/v1: sus prompts nunca salen de la máquina, lo que conviene al tratamiento de contratos, de documentos internos o de cualquier dato sensible.

2

Desarrollo y pruebas

Haga funcionar un modelo de 7 o 13 mil millones de parámetros en un VPS dedicado para prototipar sus funciones de IA antes de conectar un LLM de producción. El coste es fijo, sin facturas sorpresa, y un ollama rm deja la máquina a cero.

3

Pila de IA compartida por el equipo

Asocie Ollama a Open WebUI para dar a todo su equipo una interfaz de conversación compartida, alimentada por modelos de código abierto, sobre una infraestructura que usted controla.

Desplegar Ollama en su VPS

Guía optimizada para los VPS Cloud ServOrbit.

01

Crear el VPS

Pida un VPS ServOrbit con al menos 8 GB de RAM para un modelo de 7 a 8 mil millones de parámetros cuantizado en Q4 sobre procesador, y 16 GB para modelos más grandes. El sistema instalado es Ubuntu 24.04. Para tiempos de respuesta dignos de la producción, un servidor dotado de una GPU cambia notablemente la experiencia.

02

Desplegar Ollama

La instalación desde su área de cliente crea el contenedor ollama/ollama, monta el volumen ollama en /root/.ollama para que los modelos sobrevivan a los reinicios, y publica el servicio en el bucle local, en 127.0.0.1:11434. Nada queda expuesto a Internet en esta etapa: es algo deliberado, ya que Ollama no tiene ninguna autenticación.

03

Conectarse por primera vez

Ollama no tiene pantalla de inicio de sesión: es una API HTTP acompañada de una línea de comandos. Por SSH en el VPS, ejecute docker exec -it ollama ollama pull llama3 y luego docker exec -it ollama ollama run llama3. Conecte después una interfaz, Open WebUI por ejemplo, en lugar de exponer la API tal cual.

04

Descargar su primer modelo

Descargue un modelo con docker exec -it ollama ollama pull llama3.1:8b, compruebe que ha quedado registrado con docker exec -it ollama ollama list y luego pruebe desde el VPS: curl http://127.0.0.1:11434/api/generate -d '{"model":"llama3.1:8b","prompt":"Hola"}'.

05

Tener en cuenta la ausencia de autenticación

Ollama no pide ningún identificador y desconoce la noción de clave de API: cualquiera que alcance el servicio puede consultar sus modelos y descargar otros. Por eso ServOrbit no le vincula ningún dominio — el cifrado de un vhost protegería el transporte, no identificaría a nadie. Dos usos se sostienen: trabajar mediante un túnel SSH, o colocar delante de Ollama una pasarela que autentique, LiteLLM por ejemplo, y publicar únicamente esta.

06

Conectar sus herramientas

En Open WebUI, en Settings y luego Connections, indique http://localhost:11434. Desde un SDK de OpenAI que se ejecute en el propio VPS, configure base_url='http://127.0.0.1:11434/v1' y api_key='ollama'. Desde otra máquina no existe ningún punto de entrada público: abra un túnel SSH con ssh -L 11434:127.0.0.1:11434 root@<ip-del-vps> y luego apunte a http://localhost:11434/v1. El puerto puede reasignarse en la instalación: use el que se muestra en la ficha de la aplicación en su área de cliente, ya que 11434 es solo el valor del catálogo.

Preguntas frecuentes

Ollama es un motor de código abierto que descarga y sirve grandes modelos de lenguaje detrás de una API REST local. Véalo como un servidor de inferencia instalado en su casa: usted descarga un modelo una vez y, después, cualquier aplicación lo llama igual que llamaría a la API de OpenAI.

Integrar el botón de despliegue

¿Mantiene un proyecto que utiliza Ollama? Este botón permite a sus lectores desplegarlo en un VPS con un clic, sin leer documentación de Docker.

Deploy Ollama on ServOrbit
Markdown
[![Deploy Ollama on ServOrbit](https://servorbit.com/brand/deploy/button.svg)](https://servorbit.com/vps-cloud?template=ollama&utm_source=deploy-badge&utm_medium=referral&utm_campaign=ollama)
HTML
<a href="https://servorbit.com/vps-cloud?template=ollama&utm_source=deploy-badge&utm_medium=referral&utm_campaign=ollama"><img src="https://servorbit.com/brand/deploy/button.svg" alt="Deploy Ollama on ServOrbit" height="40"></a>

El botón lleva al pedido de un VPS con la plantilla preseleccionada. La imagen se sirve desde servorbit.com: no tiene que alojar nada por su parte.

Crear, alojar y operar soluciones de IA.

Active Ollama en su infraestructura.

VPS Cloud dedicado: IPv4 incluida, centro de datos europeo, soporte incluido. Sus datos nunca salen de su servidor.

Configuración recomendada: 8 GB mínimo (16 GB recomendado) RAM · 2 vCPU

¿Necesita ayuda?

Consulte nuestro centro de ayuda y nuestra FAQ, o contacte con nuestro equipo: llamada, WhatsApp o correo electrónico. Soporte en francés, inglés y árabe.

Escribir por WhatsAppse abre en una pestaña nueva