Guía de despliegue

Alojar Langfuse en un VPS: observabilidad LLM sin SaaS

Desplegar en un VPS Cloud →

Tutorial

Alojar Langfuse en un VPS: observabilidad LLM sin SaaS

Inteligencia Artificial7 min de lectura7 pasos

Toda aplicación impulsada por un LLM acaba planteando una pregunta que sus desarrolladores no pueden responder solo con los logs: ¿por qué se degradó esta respuesta, qué versión del prompt rindió mejor y adónde se va el dinero? Langfuse (MIT, ~30 k estrellas en GitHub, v3.212.0) es la respuesta open source: una plataforma de observabilidad full-stack para aplicaciones LLM, que usted despliega en su propio VPS y conecta a cualquier proveedor de modelos en unos minutos.

Contenido· Por qué las aplicaciones LLM necesitan una observabilidad dedicada1/7
  1. 01Por qué las aplicaciones LLM necesitan una observabilidad dedicada
  2. 02Lo que Langfuse le ofrece de entrada
  3. 03Sobre qué funciona Langfuse (y por qué necesita 4 GB de RAM)
  4. 04Desplegar Langfuse en su VPS en seis pasos
  5. 05Combínelo con LiteLLM para una visibilidad completa de los costos de la IA
  6. 06Costos LLM mostrados a $0.00 en la vista Tracing v4 — qué ocurre y cómo sortearlo
  7. 07Langfuse vs Langsmith vs Helicone

Por qué las aplicaciones LLM necesitan una observabilidad dedicada

Las herramientas de APM tradicionales (Datadog, New Relic) capturan la latencia HTTP y las tasas de error, pero son ciegas a lo que ocurre dentro de una llamada LLM. Una respuesta que llega en 800 ms puede ser igualmente falsa, tan vaga que resulte inútil, o tres veces más cara que la de la víspera porque una regresión de prompt se coló entre las mallas de la revisión de código. Langfuse resuelve este problema tratando cada interacción LLM como una traza estructurada: registra el prompt completo (incluidos el mensaje de sistema y el historial de conversación), la compleción, el modelo utilizado, el recuento de tokens, el desglose de la latencia por span, así como todas las puntuaciones de evaluación que su equipo le asocie. Después puede filtrar, comparar y reproducir cualquier traza, individualmente o de forma agregada.

Lo que Langfuse le ofrece de entrada

  • Trazado LLM full-stack: prompt, compleción, latencia, costo y número de tokens — incluidos los spans anidados para las cadenas de agentes (LangChain, LlamaIndex, Dify).
  • Hub de gestión de prompts: versione sus prompts, prepare variantes, haga pruebas A/B en producción y promueva la ganadora sin despliegue de código.
  • Framework de evaluación: ejecute LLM-as-a-judge, colas de anotación humana o funciones de scoring personalizadas sobre cualquier traza o dataset.
  • Analítica de costos: siga el consumo de tokens por modelo, endpoint, usuario y sesión — cambie de proveedor apoyándose en datos concretos, no en suposiciones.
  • Gestión de datasets: capture las trazas de producción como juegos de pruebas de referencia para la evaluación sin conexión y la detección de regresiones.
  • SDK nativo para Python y TypeScript, más una integración automática con LiteLLM, LangChain, LlamaIndex, Dify, Haystack y VercelAI.

Sobre qué funciona Langfuse (y por qué necesita 4 GB de RAM)

Langfuse v3 se presenta como un stack Docker Compose de seis servicios: langfuse (frontend Next.js + API), langfuse-worker (tareas en segundo plano y evaluaciones), postgres (estado de la aplicación), clickhouse (analítica de las trazas — almacenamiento en columnas optimizado para las series temporales de alta cardinalidad), redis (cola y caché) y minio (almacenamiento de objetos compatible con S3 para los archivos multimedia adjuntos). ClickHouse justifica el mínimo de 4 GB: su compilador JIT y su motor de ejecución vectorial necesitan margen. En un VPS poco solicitado, el stack completo consume en reposo entre 1,5 y 2 GB; bajo una carga de producción moderada, prevea 4 GB, y 8 GB para un trazado sostenido de alto rendimiento. Los seis servicios arrancan con un solo docker compose up -d y son gestionados por AWX en el flujo de un clic de ServOrbit.

Desplegar Langfuse en su VPS en seis pasos

  1. Pida un VPS Power (8 GB de RAM)

    Langfuse exige al menos 4 GB de RAM: en el catálogo, el primer plan que los supera es el VPS Power (4 vCPU, 8 GB), instalado sobre Ubuntu 24.04 — suficiente también para un tráfico de producción permanente. Elija un dominio o subdominio que usted controle — las cookies de sesión NextAuth de Langfuse exigen un verdadero dominio en HTTPS.

  2. Instalación en un clic desde el Marketplace

    Abra su panel de control ServOrbit, vaya a Marketplace → Inteligencia Artificial → Langfuse, y haga clic en Desplegar. Introduzca su dominio cuando se le solicite. Docker Compose descarga las seis imágenes y las arranca; la interfaz web está lista en el puerto 3000 en 60 a 90 segundos (la inicialización de ClickHouse en el primer arranque es la más larga).

  3. Abra la interfaz web y cree su primer proyecto

    Vaya a https://votre-domaine.com. Langfuse muestra la pantalla de registro en el primer arranque. Cree su cuenta de administrador y luego vaya a Ajustes → Proyectos → Crear un proyecto. Copie la Clave pública y la Clave secreta desde los ajustes del proyecto — las necesitará en su aplicación.

  4. Instrumente su aplicación Python o TypeScript

    En Python: pip install langfuse, defina LANGFUSE_HOST=https://votre-domaine.com, LANGFUSE_PUBLIC_KEY y LANGFUSE_SECRET_KEY, y luego decore sus llamadas LLM con @observe() o utilice langfuse.trace(). En TypeScript: npm install langfuse, inicialice el cliente con su host y sus claves. Las trazas aparecen en el panel unos segundos después de la primera llamada.

  5. Active el trazado automático si utiliza LiteLLM

    Si LiteLLM ya forma parte de su stack (lo que es probable si utiliza el stack de IA de ServOrbit), añada success_callback = ["langfuse"] a litellm_config.yaml y defina las tres variables de entorno de Langfuse. Cada llamada LLM retransmitida por el proxy — en el conjunto de los modelos posteriores — se traza automáticamente, con los datos de costo y de tokens adjuntos.

  6. Lance su primera evaluación

    Vaya a Traces, filtre una muestra representativa y haga clic en «Añadir al dataset». Abra Datasets → su dataset → Lanzar la evaluación, elija el LLM-as-a-judge con una plantilla de prompt («Evalúe la pertinencia de esta respuesta en una escala del 1 al 5») y confirme. Las puntuaciones aparecen en cada traza del conjunto y alimentan el panel analítico agregado.

  7. Conectarse por primera vez

    La URL abre la pantalla de Langfuse con un enlace «Sign up»: cree su cuenta y, después, su organización y su primer proyecto en el asistente.

Combínelo con LiteLLM para una visibilidad completa de los costos de la IA

El stack de IA de ServOrbit ya incluye LiteLLM como pasarela compatible con OpenAI. Conecte Langfuse a LiteLLM con tres variables de entorno y obtendrá una visión de conjunto completa: LiteLLM aplica los límites de tasa y enruta entre los proveedores; Langfuse registra cada traza con el prompt completo, la compleción, el modelo, los tokens y el costo. Juntos le ofrecen una capa de operaciones de IA privada y auditable — sin intermediario SaaS, sin ningún dato que salga de su infraestructura.

Costos LLM mostrados a $0.00 en la vista Tracing v4 — qué ocurre y cómo sortearlo

Un problema activo afecta a la vista Tracing v4 de Langfuse (reportado en la issue #16077, 14 comentarios en agosto de 2026): la columna Cost ($) muestra sistemáticamente $0.00 en todas las trazas.

La causa es estructural. La vista v4 lee el costo que lleva la observación raíz de cada traza, que es de tipo SPAN: un span no tiene costo propio, solo encapsula generaciones hijas. El costo real se reparte entre las observaciones de tipo GENERATION hijas, pero la vista no las agrega: lee la raíz, encuentra cero y muestra cero.

Sus datos están intactos. El costo sí queda registrado en cada generación; solo la visualización de la vista principal es falsa. Tres soluciones alternativas funcionan mientras llega la corrección oficial:

1. Pestaña Analytics / Metrics — la vista agregada calcula los costos sobre el conjunto de las generaciones, no sobre la raíz. Es la fuente fiable para seguir su consumo diario o por modelo.

2. Filtrar por tipo GENERATION en Traces — añada el filtro observation_type = GENERATION en la vista Traces. Ya no ve las trazas padre, pero cada línea muestra su costo real.

3. Abrir el detalle de una traza — el panel lateral muestra el desglose completo por span y generación, con los costos correctos. Útil para diagnosticar una traza concreta.

Si observa este comportamiento en su instancia, compruebe que está en Langfuse v3.x con Tracing v4 activado. La issue está abierta y con seguimiento del equipo de Langfuse.

Langfuse vs Langsmith vs Helicone

Langsmith (el producto alojado de LangChain) y Helicone son las principales alternativas SaaS. Ambos son excelentes — y ambos le obligan a hacer transitar sus trazas por sus servidores. Para los equipos que manipulan prompts sensibles (jurídicos, financieros, médicos), o para los entornos de conformidad que prohíben toda salida de datos hacia un tercero, el autoalojamiento no es una opción. Langfuse le ofrece el mismo conjunto de funcionalidades (trazado, evaluaciones, gestión de prompts, analítica de costos) sobre una infraestructura que usted controla. La licencia MIT significa también que puede leer, modificar y auditar cada línea del código por el que transitan sus trazas.

Despliegue Langfuse en su VPS

Obtenga una observabilidad LLM completa en un clic: rastree cada petición de IA, gestione sus prompts y controle sus costos, sobre una infraestructura que usted controla.

¿Necesita ayuda?

Consulte nuestro centro de ayuda y nuestra FAQ, o contacte con nuestro equipo: llamada, WhatsApp o correo electrónico. Soporte en francés, inglés y árabe.

Escribir por WhatsAppse abre en una pestaña nueva