Crear, alojar y operar soluciones de IA.

LLM de código abierto en el procesador, sin GPU — API compatible con OpenAI, más de 200 modelos, autoalojados con un solo comando.
LocalAI (licencia MIT, unas 47 000 estrellas en GitHub) es una alternativa libre y gratuita a la API de OpenAI. Funciona en hardware corriente, sin tarjeta gráfica: un VPS de 2 GB de RAM basta para servir Llama 3, Mistral, Phi-3, Qwen y más de doscientos modelos más detrás de una API REST compatible con OpenAI. El código que hoy llama a `openai.ChatCompletion.create()` funciona sin retoques: usted cambia la URL base y el conjunto de las llamadas se procesa localmente, sin coste por token. Frente a los otros dos componentes de inferencia del catálogo, LocalAI destaca por su amplitud: allí donde Ollama sirve únicamente texto con una gestión de modelos en línea de comandos, y donde LiteLLM se limita a enrutar sin calcular nada, LocalAI cubre desde un solo contenedor la generación de texto, la llamada a funciones, los embeddings, la generación de imágenes con Stable Diffusion y la transcripción de audio con Whisper — todo ello gobernado por API, sin línea de comandos dedicada.
Desplegado en un VPS ServOrbit, LocalAI se convierte en el motor de inferencia privado al que llaman las aplicaciones de su equipo, sus cadenas RAG y sus marcos de agentes en lugar de OpenAI: ninguna dependencia de un servicio de terceros, ningún límite de uso, ningún dato que salga de su infraestructura. LocalAI no exige ninguna clave de API: por eso el servicio nunca se publica tras un dominio y permanece ligado al bucle local del VPS. El código alojado en esa misma máquina apunta a `http://127.0.0.1:8080`; desde otro lugar, el acceso pasa por un túnel SSH.
curl http://127.0.0.1:8080/models/apply -d '{"id":"llama-3.2-3b-instruct:q4_0"}' obtiene y activa cualquier modelo compatible.Sustituya sus llamadas a la API de OpenAI por un endpoint LocalAI en su VPS. Su SaaS, su herramienta interna o su cadena RAG envía exactamente el mismo JSON, con el mismo SDK, sin coste por token. El endpoint no es público — LocalAI solo escucha en el bucle local, porque no trae autenticación alguna: el código alojado en el propio VPS apunta a http://127.0.0.1:8080/v1/chat/completions, y desde otra máquina hace falta un túnel SSH. Es el escenario ideal para los usos de gran volumen, donde la facturación por token se convierte en el cuello de botella.
Para una aplicación jurídica, médica o financiera cuyos datos no deben salir de su infraestructura, LocalAI funciona totalmente sin conexión una vez descargado el modelo. Ninguna solicitud llega a una API externa, y los archivos de modelo en formato GGUF permanecen en su propio disco, en un volumen Docker.
Ejecute modelos de embeddings (nomic-embed-text, mxbai-embed-large) localmente, junto a Qdrant en el mismo VPS, para construir una cadena de búsqueda semántica o de RAG completa. Ni coste de API de embeddings, ni datos que salgan del servidor, ni límite de velocidad.
Guía optimizada para los VPS Cloud ServOrbit.
Pida un VPS ServOrbit con al menos 2 GB de RAM; el sistema instalado es Ubuntu 24.04. Para un uso cómodo entre varias personas, o para modelos a partir de 7 mil millones de parámetros, se recomiendan 4 GB. El número de núcleos cuenta para la velocidad: 4 vCPU reducen notablemente la latencia de generación en los modelos de 3 a 7 mil millones de parámetros.
La instalación desde su área de cliente crea el contenedor localai/localai:latest, una imagen de unos 900 MB, monta el volumen local-ai en /build/models y publica el servidor de API compatible con OpenAI en el bucle local, en 127.0.0.1:8080. No se incluye ningún modelo: la primera solicitud que nombre un modelo desencadena su descarga en el volumen persistente.
LocalAI se abre sin ninguna credencial: su primera acción consiste en pasar por la galería de modelos para descargar uno, ya que la instalación no proporciona ninguno. La API compatible con OpenAI responde en la misma dirección y no está protegida por ninguna clave — mientras el servicio solo escuche en el bucle local, únicamente los usuarios que dispongan de acceso SSH al VPS pueden alcanzarla.
Basta con una sola llamada a la API: curl http://127.0.0.1:8080/models/apply -H 'Content-Type: application/json' -d '{"id":"llama-3.2-3b-instruct:q4_0"}'. LocalAI obtiene el archivo GGUF y registra el modelo. La cuantización Q4 de un modelo de 3 mil millones de parámetros cabe en 2 GB de RAM; la de un modelo de 7 mil millones necesita unos 4.
Pruebe la API desde el VPS: curl http://127.0.0.1:8080/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"llama-3.2-3b-instruct:q4_0","messages":[{"role":"user","content":"¡Hola!"}]}'. La respuesta tiene exactamente la forma de la de OpenAI: cambiar la URL base en su código existente basta para que funcione.
Desde el propio VPS, configure base_url='http://127.0.0.1:8080/v1' y api_key='not-needed' en cualquier SDK de OpenAI — es el caso normal, ya que la aplicación que consume LocalAI se ejecuta en la misma máquina. Desde su equipo, abra un túnel SSH — ssh -L 8080:127.0.0.1:8080 root@<ip-del-vps> — y apunte a http://localhost:8080/v1. El puerto puede reasignarse durante la instalación: use el que aparece en la ficha de la aplicación en su área de cliente, ya que 8080 es solo el valor del catálogo. En LangChain, eso da ChatOpenAI(base_url=..., api_key='x'); en LiteLLM, anteponga localai/ al modelo; en Open WebUI, declare una conexión OpenAI con esa misma URL base. Su código existente no necesita ninguna otra modificación.
LocalAI está abierto por defecto: no se exige ninguna clave. La aplicación sabe reclamar una mediante la variable de entorno LOCALAI_API_KEY, pero la instalación del catálogo no establece ninguna — el endpoint no está autenticado, y precisamente por eso nunca se publica tras un dominio: un motor de inferencia abierto a Internet es su procesador y su factura a disposición de quien lo encuentre. Para exponer una API pública, publique en su lugar una pasarela que autentique — LiteLLM por ejemplo — y deje LocalAI detrás de ella, en el bucle local.
¿Mantiene un proyecto que utiliza LocalAI? Este botón permite a sus lectores desplegarlo en un VPS con un clic, sin leer documentación de Docker.
[](https://servorbit.com/vps-cloud?template=local-ai&utm_source=deploy-badge&utm_medium=referral&utm_campaign=local-ai)<a href="https://servorbit.com/vps-cloud?template=local-ai&utm_source=deploy-badge&utm_medium=referral&utm_campaign=local-ai"><img src="https://servorbit.com/brand/deploy/button.svg" alt="Deploy LocalAI on ServOrbit" height="40"></a>El botón lleva al pedido de un VPS con la plantilla preseleccionada. La imagen se sirve desde servorbit.com: no tiene que alojar nada por su parte.
Sirva LLM de código abierto desde su propio servidor. Descargue Llama 3, Mistral, Qwen o DeepSeek con un solo comando, detrás de una API compatible con OpenAI y sin coste por token.
Inteligencia ArtificialPasarela de API autoalojada para más de 100 proveedores de LLM: un único punto de entrada compatible con OpenAI que enruta hacia Ollama, Anthropic, Azure y los demás, con claves virtuales, cuotas y seguimiento del gasto.
Inteligencia ArtificialInterfaz web para interactuar con sus LLM locales o remotos. Sus datos permanecen en su infraestructura — ningún tercero implicado.
Crear, alojar y operar soluciones de IA.
VPS Cloud dedicado: IPv4 incluida, centro de datos europeo, soporte incluido. Sus datos nunca salen de su servidor.
Configuración recomendada: 2 GB (4 GB recomendado para los modelos de 7 mil millones de parámetros y más) RAM · 2 vCPU (4 vCPU recomendado)
Consulte nuestro centro de ayuda y nuestra FAQ, o contacte con nuestro equipo: llamada, WhatsApp o correo electrónico. Soporte en francés, inglés y árabe.
Escribir por WhatsAppse abre en una pestaña nueva