Crear, alojar y operar soluciones de IA.

Logo de LocalAI

LocalAI

LLM de código abierto en el procesador, sin GPU — API compatible con OpenAI, más de 200 modelos, autoalojados con un solo comando.

2 GB (4 GB recomendado para los modelos de 7 mil millones de parámetros y más) RAM 2 vCPU (4 vCPU recomendado) Puerto 8080 Disponible

Stack técnico

DockerGollama.cpp
RAM mínima2 GB (4 GB recomendado para los modelos de 7 mil millones de parámetros y más)
CPU mínima2 vCPU (4 vCPU recomendado)
Puerto por defecto8080
SO compatiblesubuntu-24.04

LocalAI (licencia MIT, unas 47 000 estrellas en GitHub) es una alternativa libre y gratuita a la API de OpenAI. Funciona en hardware corriente, sin tarjeta gráfica: un VPS de 2 GB de RAM basta para servir Llama 3, Mistral, Phi-3, Qwen y más de doscientos modelos más detrás de una API REST compatible con OpenAI. El código que hoy llama a `openai.ChatCompletion.create()` funciona sin retoques: usted cambia la URL base y el conjunto de las llamadas se procesa localmente, sin coste por token. Frente a los otros dos componentes de inferencia del catálogo, LocalAI destaca por su amplitud: allí donde Ollama sirve únicamente texto con una gestión de modelos en línea de comandos, y donde LiteLLM se limita a enrutar sin calcular nada, LocalAI cubre desde un solo contenedor la generación de texto, la llamada a funciones, los embeddings, la generación de imágenes con Stable Diffusion y la transcripción de audio con Whisper — todo ello gobernado por API, sin línea de comandos dedicada.

Desplegado en un VPS ServOrbit, LocalAI se convierte en el motor de inferencia privado al que llaman las aplicaciones de su equipo, sus cadenas RAG y sus marcos de agentes en lugar de OpenAI: ninguna dependencia de un servicio de terceros, ningún límite de uso, ningún dato que salga de su infraestructura. LocalAI no exige ninguna clave de API: por eso el servicio nunca se publica tras un dominio y permanece ligado al bucle local del VPS. El código alojado en esa misma máquina apunta a `http://127.0.0.1:8080`; desde otro lugar, el acceso pasa por un túnel SSH.

Funcionalidades clave

API REST compatible con OpenAI — sustitución directa, compatible sin retoques con los SDK de LangChain, LlamaIndex y LiteLLM.
Inferencia en el procesador — funciona en cualquier VPS sin GPU gracias a llama.cpp, con rutas SIMD optimizadas para Intel y ARM.
Más de 200 modelos compatibles — Llama 3, Mistral, Phi-3, Qwen 2.5, DeepSeek, Gemma 2, Falcon y cualquier modelo en formato GGUF.
Multimodal: generación de texto, llamada a funciones y herramientas, embeddings, generación de imágenes (Stable Diffusion) y transcripción de audio (Whisper).
Descarga de un modelo por su nombre — curl http://127.0.0.1:8080/models/apply -d '{"id":"llama-3.2-3b-instruct:q4_0"}' obtiene y activa cualquier modelo compatible.
Licencia MIT — totalmente auditable, sin telemetría, utilizable sin conexión a Internet; la versión 4.6.2, publicada el 6 de julio de 2026, añade el modo de clúster distribuido y un enrutamiento que tiene en cuenta la caché de prefijos.
Componible con LiteLLM y Open WebUI — LocalAI aporta la capa de inferencia, LiteLLM añade el enrutamiento multiproveedor y Open WebUI aporta la interfaz de chat.

¿Cuándo usar esta solución?

1

Motor de LLM privado para sus aplicaciones

Sustituya sus llamadas a la API de OpenAI por un endpoint LocalAI en su VPS. Su SaaS, su herramienta interna o su cadena RAG envía exactamente el mismo JSON, con el mismo SDK, sin coste por token. El endpoint no es público — LocalAI solo escucha en el bucle local, porque no trae autenticación alguna: el código alojado en el propio VPS apunta a http://127.0.0.1:8080/v1/chat/completions, y desde otra máquina hace falta un túnel SSH. Es el escenario ideal para los usos de gran volumen, donde la facturación por token se convierte en el cuello de botella.

2

Inferencia sin conexión para datos sensibles

Para una aplicación jurídica, médica o financiera cuyos datos no deben salir de su infraestructura, LocalAI funciona totalmente sin conexión una vez descargado el modelo. Ninguna solicitud llega a una API externa, y los archivos de modelo en formato GGUF permanecen en su propio disco, en un volumen Docker.

3

Embeddings y búsqueda semántica sin clave de API

Ejecute modelos de embeddings (nomic-embed-text, mxbai-embed-large) localmente, junto a Qdrant en el mismo VPS, para construir una cadena de búsqueda semántica o de RAG completa. Ni coste de API de embeddings, ni datos que salgan del servidor, ni límite de velocidad.

Desplegar LocalAI en su VPS

Guía optimizada para los VPS Cloud ServOrbit.

01

Crear el VPS

Pida un VPS ServOrbit con al menos 2 GB de RAM; el sistema instalado es Ubuntu 24.04. Para un uso cómodo entre varias personas, o para modelos a partir de 7 mil millones de parámetros, se recomiendan 4 GB. El número de núcleos cuenta para la velocidad: 4 vCPU reducen notablemente la latencia de generación en los modelos de 3 a 7 mil millones de parámetros.

02

Desplegar LocalAI

La instalación desde su área de cliente crea el contenedor localai/localai:latest, una imagen de unos 900 MB, monta el volumen local-ai en /build/models y publica el servidor de API compatible con OpenAI en el bucle local, en 127.0.0.1:8080. No se incluye ningún modelo: la primera solicitud que nombre un modelo desencadena su descarga en el volumen persistente.

03

Conectarse por primera vez

LocalAI se abre sin ninguna credencial: su primera acción consiste en pasar por la galería de modelos para descargar uno, ya que la instalación no proporciona ninguno. La API compatible con OpenAI responde en la misma dirección y no está protegida por ninguna clave — mientras el servicio solo escuche en el bucle local, únicamente los usuarios que dispongan de acceso SSH al VPS pueden alcanzarla.

04

Descargar un modelo

Basta con una sola llamada a la API: curl http://127.0.0.1:8080/models/apply -H 'Content-Type: application/json' -d '{"id":"llama-3.2-3b-instruct:q4_0"}'. LocalAI obtiene el archivo GGUF y registra el modelo. La cuantización Q4 de un modelo de 3 mil millones de parámetros cabe en 2 GB de RAM; la de un modelo de 7 mil millones necesita unos 4.

05

Hacer su primera llamada a la API

Pruebe la API desde el VPS: curl http://127.0.0.1:8080/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"llama-3.2-3b-instruct:q4_0","messages":[{"role":"user","content":"¡Hola!"}]}'. La respuesta tiene exactamente la forma de la de OpenAI: cambiar la URL base en su código existente basta para que funcione.

06

Conectar sus aplicaciones a LocalAI

Desde el propio VPS, configure base_url='http://127.0.0.1:8080/v1' y api_key='not-needed' en cualquier SDK de OpenAI — es el caso normal, ya que la aplicación que consume LocalAI se ejecuta en la misma máquina. Desde su equipo, abra un túnel SSH — ssh -L 8080:127.0.0.1:8080 root@<ip-del-vps> — y apunte a http://localhost:8080/v1. El puerto puede reasignarse durante la instalación: use el que aparece en la ficha de la aplicación en su área de cliente, ya que 8080 es solo el valor del catálogo. En LangChain, eso da ChatOpenAI(base_url=..., api_key='x'); en LiteLLM, anteponga localai/ al modelo; en Open WebUI, declare una conexión OpenAI con esa misma URL base. Su código existente no necesita ninguna otra modificación.

07

Proteger el endpoint

LocalAI está abierto por defecto: no se exige ninguna clave. La aplicación sabe reclamar una mediante la variable de entorno LOCALAI_API_KEY, pero la instalación del catálogo no establece ninguna — el endpoint no está autenticado, y precisamente por eso nunca se publica tras un dominio: un motor de inferencia abierto a Internet es su procesador y su factura a disposición de quien lo encuentre. Para exponer una API pública, publique en su lugar una pasarela que autentique — LiteLLM por ejemplo — y deje LocalAI detrás de ella, en el bucle local.

Preguntas frecuentes

LocalAI es un servidor libre y gratuito, con licencia MIT, que ejecuta grandes modelos de lenguaje localmente en el procesador. Expone una API REST compatible con OpenAI: su código existente funciona sin modificaciones, basta con sustituir la URL base de la API por la de su servidor.

Integrar el botón de despliegue

¿Mantiene un proyecto que utiliza LocalAI? Este botón permite a sus lectores desplegarlo en un VPS con un clic, sin leer documentación de Docker.

Deploy LocalAI on ServOrbit
Markdown
[![Deploy LocalAI on ServOrbit](https://servorbit.com/brand/deploy/button.svg)](https://servorbit.com/vps-cloud?template=local-ai&utm_source=deploy-badge&utm_medium=referral&utm_campaign=local-ai)
HTML
<a href="https://servorbit.com/vps-cloud?template=local-ai&utm_source=deploy-badge&utm_medium=referral&utm_campaign=local-ai"><img src="https://servorbit.com/brand/deploy/button.svg" alt="Deploy LocalAI on ServOrbit" height="40"></a>

El botón lleva al pedido de un VPS con la plantilla preseleccionada. La imagen se sirve desde servorbit.com: no tiene que alojar nada por su parte.

Crear, alojar y operar soluciones de IA.

Active LocalAI en su infraestructura.

VPS Cloud dedicado: IPv4 incluida, centro de datos europeo, soporte incluido. Sus datos nunca salen de su servidor.

Configuración recomendada: 2 GB (4 GB recomendado para los modelos de 7 mil millones de parámetros y más) RAM · 2 vCPU (4 vCPU recomendado)

¿Necesita ayuda?

Consulte nuestro centro de ayuda y nuestra FAQ, o contacte con nuestro equipo: llamada, WhatsApp o correo electrónico. Soporte en francés, inglés y árabe.

Escribir por WhatsAppse abre en una pestaña nueva