Crear, alojar y operar soluciones de IA.

Logo de LiteLLM

LiteLLM

Pasarela LLM autoalojada — un único punto de entrada compatible con OpenAI que enruta hacia Ollama, Anthropic y más de 100 proveedores.

1 GB (2 GB recomendado) RAM 2 vCPU Puerto 4000 Disponible

Stack técnico

DockerPythonPostgreSQL 16
RAM mínima1 GB (2 GB recomendado)
CPU mínima2 vCPU
Puerto por defecto4000
SO compatiblesubuntu-24.04

LiteLLM es un proxy de LLM de código abierto (licencia Apache 2.0) que presenta una API unificada, compatible con OpenAI, delante de más de cien proveedores de modelos. La diferencia con Ollama y LocalAI es estructural: estos dos ejecutan los modelos, LiteLLM no ejecuta ninguno. Se sitúa delante de ellos y arbitra — cada solicitud parte hacia el Ollama instalado en el mismo VPS, hacia Anthropic Claude, hacia Azure OpenAI o hacia cualquier otro motor declarado, sin que cambie una sola línea de su aplicación. Es además el único de los tres componentes de inferencia del catálogo que aporta una capa de administración: interfaz web, claves virtuales, topes de gasto y límites de velocidad por clave.

Desplegado en un VPS ServOrbit, LiteLLM ofrece a su equipo una pasarela de IA privada con un panel de uso integrado. Funciona en dos contenedores — la pasarela Python y una base de datos PostgreSQL 16 que conserva las claves, los registros de solicitudes y los contadores de gasto — y el servicio solo se publica en el bucle local del VPS. Por eso esta aplicación requiere un dominio: es a través de `https://<su-dominio>` como sus desarrolladores y sus aplicaciones la alcanzan, ya que ServOrbit instala el vhost de nginx y el certificado TLS en cuanto el dominio queda asociado. LiteLLM se coloca igual de bien delante de un Ollama local, para una inferencia totalmente sin conexión, que delante de API comerciales, para centralizar el seguimiento de los costos de todos sus proyectos.

Funcionalidades clave

API REST compatible con OpenAI — sustitución directa, compatible con todos los SDK que hablan con OpenAI
Más de 100 proveedores: Ollama, Anthropic, OpenAI, Azure, Mistral, Cohere, Bedrock y otros
Límites de velocidad y topes de presupuesto por clave — lo necesario para frenar una desviación de costos en un contexto multiequipo o multiproyecto
Análisis del gasto en tiempo real, con un detalle por modelo y por clave
Reparto de carga y conmutación automática entre varios puntos de entrada de proveedores
Licencia Apache 2.0 — totalmente auditable, sin telemetría y capaz de funcionar sin conexión a Internet con Ollama

¿Cuándo usar esta solución?

1

Backend de IA multimodelo

Envíe las tareas sensibles al costo hacia una instancia local de Ollama y las solicitudes de razonamiento complejo hacia Anthropic Claude, desde la misma llamada al SDK de OpenAI en su aplicación. El arbitraje se cambia en la configuración de LiteLLM, nunca en el código de la aplicación.

2

Control del presupuesto de IA de un equipo

Distribuya una clave de API virtual por equipo o por proyecto, con un tope de gasto mensual. Cuando una clave alcanza su presupuesto, LiteLLM responde con un error 429: se acabaron las facturas de nube descubiertas a fin de mes.

3

Cambio de proveedor de LLM

Haga que toda su aplicación pase de un proveedor a otro modificando un archivo de configuración. La superficie compatible con OpenAI garantiza que ningún código de aplicación se mueva: pasar de GPT-4 a Llama 3 servido por Ollama no exige tocar un solo import.

Desplegar LiteLLM en su VPS

Guía optimizada para los VPS Cloud ServOrbit.

01

Pedir el VPS

Un VPS ServOrbit de 1 GB de RAM basta para un uso individual: LiteLLM en sí consume unos 256 MB y PostgreSQL ocupa la mayor parte del resto. Cuente con 2 GB para un equipo que envía solicitudes en paralelo. Prevea también el dominio por el que se alcanzará la pasarela: no es accesible de otro modo.

02

Dejar que la instalación genere los secretos

No tiene nada que fabricar a mano: el despliegue genera la clave maestra LITELLM_MASTER_KEY, las credenciales de la base de datos PostgreSQL y la contraseña de la interfaz de administración. La clave maestra abre el panel de control y el conjunto de los puntos de entrada de administración — trátela como una contraseña y consérvela fuera del servidor.

03

Conectarse por primera vez

Abra la interfaz de administración en https://<su-dominio>/ui: LiteLLM muestra un formulario de identificador y contraseña. Introduzca admin y la contraseña generada durante la instalación, que se muestra en la ficha de la aplicación en su área de cliente, y cree después sus claves virtuales desde el panel de control.

04

Lo que despliega la instalación

Dos contenedores se inician a la vez: la pasarela ghcr.io/berriai/litellm:main-latest, publicada en 127.0.0.1:4000, y una base de datos postgres:16-alpine. Los datos persisten en dos volúmenes, litellm_db para la base de datos y litellm_config para la configuración de la pasarela. Cuente unos treinta segundos en el primer arranque.

05

Declarar su primer modelo

En el panel de control, abra Models y luego Add. Para enrutar hacia un Ollama instalado en la misma máquina, introduzca un nombre de modelo del tipo ollama/llama3.1 con la URL base http://host.docker.internal:11434; para un proveedor remoto, pegue la clave de API correspondiente, por ejemplo para anthropic/claude-3-5-haiku-20241022. Compruébelo con curl -H "Authorization: Bearer <LITELLM_MASTER_KEY>" https://<su-dominio>/v1/models: esa misma dirección, https://<su-dominio>/v1, es la URL base que debe indicar a sus SDK.

06

Distribuir claves a sus equipos

En la sección API Keys del panel de control, cree una clave virtual por equipo, con un max_budget si procede — el presupuesto acumulado, expresado en dólares —, un tpm_limit en tokens por minuto y un rpm_limit en solicitudes por minuto. Sus desarrolladores apuntan su SDK de OpenAI a la pasarela, y el gasto se contabiliza clave por clave.

Preguntas frecuentes

LiteLLM es un proxy de LLM de código abierto, con licencia Apache 2.0, que expone una API unificada compatible con OpenAI delante de más de cien proveedores de modelos: Ollama, Anthropic Claude, OpenAI GPT-4, Azure OpenAI, Mistral, Cohere y otros. Se intercala entre sus aplicaciones y los motores de inferencia, y se encarga del enrutamiento, la limitación de velocidad y el seguimiento de los costos.

Integrar el botón de despliegue

¿Mantiene un proyecto que utiliza LiteLLM? Este botón permite a sus lectores desplegarlo en un VPS con un clic, sin leer documentación de Docker.

Deploy LiteLLM on ServOrbit
Markdown
[![Deploy LiteLLM on ServOrbit](https://servorbit.com/brand/deploy/button.svg)](https://servorbit.com/vps-cloud?template=litellm&utm_source=deploy-badge&utm_medium=referral&utm_campaign=litellm)
HTML
<a href="https://servorbit.com/vps-cloud?template=litellm&utm_source=deploy-badge&utm_medium=referral&utm_campaign=litellm"><img src="https://servorbit.com/brand/deploy/button.svg" alt="Deploy LiteLLM on ServOrbit" height="40"></a>

El botón lleva al pedido de un VPS con la plantilla preseleccionada. La imagen se sirve desde servorbit.com: no tiene que alojar nada por su parte.

Crear, alojar y operar soluciones de IA.

Active LiteLLM en su infraestructura.

VPS Cloud dedicado: IPv4 incluida, centro de datos europeo, soporte incluido. Sus datos nunca salen de su servidor.

Configuración recomendada: 1 GB (2 GB recomendado) RAM · 2 vCPU

¿Necesita ayuda?

Consulte nuestro centro de ayuda y nuestra FAQ, o contacte con nuestro equipo: llamada, WhatsApp o correo electrónico. Soporte en francés, inglés y árabe.

Escribir por WhatsAppse abre en una pestaña nueva