[{"data":1,"prerenderedAt":122},["ShallowReactive",2],{"seo-verification":3,"marketplace-app-es-local-ai":6},{"google":4,"bing":5},"EycwPY2XMyTkVzas3n1ygeNJFGAH513qrMjfDljzsMQ","",{"key":7,"data":8},"marketplace-app-es-local-ai",{"slug":9,"slugs":10,"categorySlugs":11,"name":16,"description":17,"phase":18,"unavailableReason":19,"docsUrl":20,"logo":21,"github":22,"tagline":23,"longDescription":24,"features":25,"useCases":33,"steps":43,"faq":65,"specs":84,"compatibleOs":92,"relatedApps":94,"relatedPosts":115,"category":119},"local-ai",{"fr":9,"en":9,"ar":9,"es":9},{"fr":12,"en":13,"ar":14,"es":15},"ia","artificial-intelligence","الذكاء-الاصطناعي","inteligencia-artificial","LocalAI","Ejecute LLM de código abierto en el procesador, sin tarjeta gráfica. API compatible con OpenAI, más de 200 modelos (Llama, Mistral, Phi), totalmente autoalojada en su VPS.",1,null,"https:\u002F\u002Fservorbit.com\u002Fblog\u002Fcomo-alojar-localai-en-un-vps","https:\u002F\u002Fraw.githubusercontent.com\u002Fmudler\u002FLocalAI\u002Fmaster\u002Fcore\u002Fhttp\u002Fstatic\u002Flogo.png","https:\u002F\u002Fgithub.com\u002Fmudler\u002FLocalAI","LLM de código abierto en el procesador, sin GPU — API compatible con OpenAI, más de 200 modelos, autoalojados con un solo comando.","LocalAI (licencia MIT, unas 47 000 estrellas en GitHub) es una alternativa libre y gratuita a la API de OpenAI. Funciona en hardware corriente, sin tarjeta gráfica: un VPS de 2 GB de RAM basta para servir Llama 3, Mistral, Phi-3, Qwen y más de doscientos modelos más detrás de una API REST compatible con OpenAI. El código que hoy llama a `openai.ChatCompletion.create()` funciona sin retoques: usted cambia la URL base y el conjunto de las llamadas se procesa localmente, sin coste por token. Frente a los otros dos componentes de inferencia del catálogo, LocalAI destaca por su amplitud: allí donde Ollama sirve únicamente texto con una gestión de modelos en línea de comandos, y donde LiteLLM se limita a enrutar sin calcular nada, LocalAI cubre desde un solo contenedor la generación de texto, la llamada a funciones, los embeddings, la generación de imágenes con Stable Diffusion y la transcripción de audio con Whisper — todo ello gobernado por API, sin línea de comandos dedicada.\n\nDesplegado en un VPS ServOrbit, LocalAI se convierte en el motor de inferencia privado al que llaman las aplicaciones de su equipo, sus cadenas RAG y sus marcos de agentes en lugar de OpenAI: ninguna dependencia de un servicio de terceros, ningún límite de uso, ningún dato que salga de su infraestructura. LocalAI no exige ninguna clave de API: por eso el servicio nunca se publica tras un dominio y permanece ligado al bucle local del VPS. El código alojado en esa misma máquina apunta a `http:\u002F\u002F127.0.0.1:8080`; desde otro lugar, el acceso pasa por un túnel SSH.",[26,27,28,29,30,31,32],"API REST compatible con OpenAI — sustitución directa, compatible sin retoques con los SDK de LangChain, LlamaIndex y LiteLLM.","Inferencia en el procesador — funciona en cualquier VPS sin GPU gracias a llama.cpp, con rutas SIMD optimizadas para Intel y ARM.","Más de 200 modelos compatibles — Llama 3, Mistral, Phi-3, Qwen 2.5, DeepSeek, Gemma 2, Falcon y cualquier modelo en formato GGUF.","Multimodal: generación de texto, llamada a funciones y herramientas, embeddings, generación de imágenes (Stable Diffusion) y transcripción de audio (Whisper).","Descarga de un modelo por su nombre — `curl http:\u002F\u002F127.0.0.1:8080\u002Fmodels\u002Fapply -d '{\"id\":\"llama-3.2-3b-instruct:q4_0\"}'` obtiene y activa cualquier modelo compatible.","Licencia MIT — totalmente auditable, sin telemetría, utilizable sin conexión a Internet; la versión 4.6.2, publicada el 6 de julio de 2026, añade el modo de clúster distribuido y un enrutamiento que tiene en cuenta la caché de prefijos.","Componible con LiteLLM y Open WebUI — LocalAI aporta la capa de inferencia, LiteLLM añade el enrutamiento multiproveedor y Open WebUI aporta la interfaz de chat.",[34,37,40],{"title":35,"body":36},"Motor de LLM privado para sus aplicaciones","Sustituya sus llamadas a la API de OpenAI por un endpoint LocalAI en su VPS. Su SaaS, su herramienta interna o su cadena RAG envía exactamente el mismo JSON, con el mismo SDK, sin coste por token. El endpoint no es público — LocalAI solo escucha en el bucle local, porque no trae autenticación alguna: el código alojado en el propio VPS apunta a `http:\u002F\u002F127.0.0.1:8080\u002Fv1\u002Fchat\u002Fcompletions`, y desde otra máquina hace falta un túnel SSH. Es el escenario ideal para los usos de gran volumen, donde la facturación por token se convierte en el cuello de botella.",{"title":38,"body":39},"Inferencia sin conexión para datos sensibles","Para una aplicación jurídica, médica o financiera cuyos datos no deben salir de su infraestructura, LocalAI funciona totalmente sin conexión una vez descargado el modelo. Ninguna solicitud llega a una API externa, y los archivos de modelo en formato GGUF permanecen en su propio disco, en un volumen Docker.",{"title":41,"body":42},"Embeddings y búsqueda semántica sin clave de API","Ejecute modelos de embeddings (nomic-embed-text, mxbai-embed-large) localmente, junto a Qdrant en el mismo VPS, para construir una cadena de búsqueda semántica o de RAG completa. Ni coste de API de embeddings, ni datos que salgan del servidor, ni límite de velocidad.",[44,47,50,53,56,59,62],{"title":45,"body":46},"Crear el VPS","Pida un VPS ServOrbit con al menos 2 GB de RAM; el sistema instalado es Ubuntu 24.04. Para un uso cómodo entre varias personas, o para modelos a partir de 7 mil millones de parámetros, se recomiendan 4 GB. El número de núcleos cuenta para la velocidad: 4 vCPU reducen notablemente la latencia de generación en los modelos de 3 a 7 mil millones de parámetros.",{"title":48,"body":49},"Desplegar LocalAI","La instalación desde su área de cliente crea el contenedor `localai\u002Flocalai:latest`, una imagen de unos 900 MB, monta el volumen `local-ai` en `\u002Fbuild\u002Fmodels` y publica el servidor de API compatible con OpenAI en el bucle local, en `127.0.0.1:8080`. No se incluye ningún modelo: la primera solicitud que nombre un modelo desencadena su descarga en el volumen persistente.",{"title":51,"body":52},"Conectarse por primera vez","LocalAI se abre sin ninguna credencial: su primera acción consiste en pasar por la galería de modelos para descargar uno, ya que la instalación no proporciona ninguno. La API compatible con OpenAI responde en la misma dirección y no está protegida por ninguna clave — mientras el servicio solo escuche en el bucle local, únicamente los usuarios que dispongan de acceso SSH al VPS pueden alcanzarla.",{"title":54,"body":55},"Descargar un modelo","Basta con una sola llamada a la API: `curl http:\u002F\u002F127.0.0.1:8080\u002Fmodels\u002Fapply -H 'Content-Type: application\u002Fjson' -d '{\"id\":\"llama-3.2-3b-instruct:q4_0\"}'`. LocalAI obtiene el archivo GGUF y registra el modelo. La cuantización Q4 de un modelo de 3 mil millones de parámetros cabe en 2 GB de RAM; la de un modelo de 7 mil millones necesita unos 4.",{"title":57,"body":58},"Hacer su primera llamada a la API","Pruebe la API desde el VPS: `curl http:\u002F\u002F127.0.0.1:8080\u002Fv1\u002Fchat\u002Fcompletions -H 'Content-Type: application\u002Fjson' -d '{\"model\":\"llama-3.2-3b-instruct:q4_0\",\"messages\":[{\"role\":\"user\",\"content\":\"¡Hola!\"}]}'`. La respuesta tiene exactamente la forma de la de OpenAI: cambiar la URL base en su código existente basta para que funcione.",{"title":60,"body":61},"Conectar sus aplicaciones a LocalAI","Desde el propio VPS, configure `base_url='http:\u002F\u002F127.0.0.1:8080\u002Fv1'` y `api_key='not-needed'` en cualquier SDK de OpenAI — es el caso normal, ya que la aplicación que consume LocalAI se ejecuta en la misma máquina. Desde su equipo, abra un túnel SSH — `ssh -L 8080:127.0.0.1:8080 root@\u003Cip-del-vps>` — y apunte a `http:\u002F\u002Flocalhost:8080\u002Fv1`. El puerto puede reasignarse durante la instalación: use el que aparece en la ficha de la aplicación en su área de cliente, ya que 8080 es solo el valor del catálogo. En LangChain, eso da `ChatOpenAI(base_url=..., api_key='x')`; en LiteLLM, anteponga `localai\u002F` al modelo; en Open WebUI, declare una conexión OpenAI con esa misma URL base. Su código existente no necesita ninguna otra modificación.",{"title":63,"body":64},"Proteger el endpoint","LocalAI está abierto por defecto: no se exige ninguna clave. La aplicación sabe reclamar una mediante la variable de entorno `LOCALAI_API_KEY`, pero la instalación del catálogo no establece ninguna — el endpoint no está autenticado, y precisamente por eso nunca se publica tras un dominio: un motor de inferencia abierto a Internet es su procesador y su factura a disposición de quien lo encuentre. Para exponer una API pública, publique en su lugar una pasarela que autentique — LiteLLM por ejemplo — y deje LocalAI detrás de ella, en el bucle local.",[66,69,72,75,78,81],{"q":67,"a":68},"¿Qué es LocalAI?","LocalAI es un servidor libre y gratuito, con licencia MIT, que ejecuta grandes modelos de lenguaje localmente en el procesador. Expone una API REST compatible con OpenAI: su código existente funciona sin modificaciones, basta con sustituir la URL base de la API por la de su servidor.",{"q":70,"a":71},"¿Hace falta una GPU para ejecutar LocalAI?","No. LocalAI se basa en llama.cpp, que aprovecha eficazmente el procesador gracias a las instrucciones SIMD (AVX2 y AVX-512 en Intel, NEON en ARM). Un VPS de 2 a 4 GB de RAM y de 2 a 4 vCPU basta para modelos de 3 a 7 mil millones de parámetros. La aceleración por GPU sigue siendo posible si el servidor dispone de una tarjeta compatible con CUDA.",{"q":73,"a":74},"¿Qué modelos se pueden ejecutar?","LocalAI acepta cualquier modelo en formato GGUF, lo que cubre la práctica totalidad de los LLM de código abierto: Llama 3.x, Mistral, Phi-3, 3.5 y 4 Mini, Qwen 2.5, DeepSeek-R1, Gemma 2, Falcon y otros. Basta con una sola llamada a la API para obtener un modelo, que LocalAI descarga automáticamente desde Hugging Face.",{"q":76,"a":77},"¿Qué diferencia hay con Ollama?","Ambos ejecutan LLM localmente en el procesador. La ventaja de LocalAI reside en su versatilidad: admite más motores, no solo llama.cpp, y abarca la generación de imágenes, la transcripción de audio con Whisper y los embeddings desde una sola API. Ollama, por su parte, es más sencillo de poner en marcha y cuenta con una biblioteca de modelos más amplia por defecto. Ambos exponen una API compatible con OpenAI.",{"q":79,"a":80},"¿Mis datos siguen siendo privados?","Sí. Toda la inferencia se realiza en su VPS: ninguna solicitud se envía nunca a una API externa. Los modelos se almacenan en un volumen Docker, en su propio disco. LocalAI no emite ninguna telemetría por defecto y su código, con licencia MIT, es totalmente auditable.",{"q":82,"a":83},"¿Qué necesidades de RAM hay que prever?","Un modelo de 3 mil millones de parámetros cuantizado en Q4 necesita unos 2 GB de RAM; uno de 7 mil millones, unos 4 GB; uno de 13 mil millones, unos 8 GB. En las configuraciones más pequeñas, de 2 GB, Phi-3 Mini —3800 millones de parámetros en Q4— funciona bien y ofrece una calidad de razonamiento notable para su tamaño.",{"ram":85,"cpu":86,"stack":87,"port":91},"2 GB (4 GB recomendado para los modelos de 7 mil millones de parámetros y más)","2 vCPU (4 vCPU recomendado)",[88,89,90],"Docker","Go","llama.cpp","8080",[93],"ubuntu-24.04",[95,103,109],{"name":96,"slug":97,"categorySlug":15,"categoryName":98,"categoryColor":99,"logo":100,"tagline":101,"description":102},"Ollama","ollama","Inteligencia Artificial","text-purple-400 bg-purple-500\u002F10","https:\u002F\u002Fcdn.simpleicons.org\u002Follama","Sirva LLM de código abierto desde su VPS — API compatible con OpenAI, sin coste por token.","Sirva LLM de código abierto desde su propio servidor. Descargue Llama 3, Mistral, Qwen o DeepSeek con un solo comando, detrás de una API compatible con OpenAI y sin coste por token.",{"name":104,"slug":105,"categorySlug":15,"categoryName":98,"categoryColor":99,"logo":106,"tagline":107,"description":108},"LiteLLM","litellm","https:\u002F\u002Favatars.githubusercontent.com\u002Fu\u002F132372032","Pasarela LLM autoalojada — un único punto de entrada compatible con OpenAI que enruta hacia Ollama, Anthropic y más de 100 proveedores.","Pasarela de API autoalojada para más de 100 proveedores de LLM: un único punto de entrada compatible con OpenAI que enruta hacia Ollama, Anthropic, Azure y los demás, con claves virtuales, cuotas y seguimiento del gasto.",{"name":110,"slug":111,"categorySlug":15,"categoryName":98,"categoryColor":99,"logo":112,"tagline":113,"description":114},"Open WebUI","open-webui","https:\u002F\u002Fcdn.jsdelivr.net\u002Fgh\u002Fselfhst\u002Ficons\u002Fsvg\u002Fopen-webui.svg","Interfaz web para sus LLM — Ollama, OpenAI, Mistral — alojada en su propio servidor.","Interfaz web para interactuar con sus LLM locales o remotos. Sus datos permanecen en su infraestructura — ningún tercero implicado.",[116,117,118],"self-host-litellm-vps","heberger-ollama-vps","deployer-dify-vps",{"key":12,"slug":15,"name":98,"objective":120,"icon":121,"color":99},"Crear, alojar y operar soluciones de IA.","ai",1789665092445]