Tutorial

Migrar de Datadog a Prometheus, Grafana y Loki

Despliegue8 min de lectura6 pasos

En 2026, varios equipos vieron su factura de Datadog superar un umbral difícil de justificar. El artículo de Gabriel Anhaia publicado en dev.to en abril de 2026 popularizó el caso: 50.000 $ al año reducidos a 0 $ en costes de software, siendo el único coste residual el VPS que ejecuta la stack. Esta guía cubre la migración componente a componente: métricas, logs, dashboards y alertas, con requisitos de VPS realistas y las limitaciones que se asumen al salir de Datadog.

Contenido· Por qué cambió la factura de Datadog en 20261/8
  1. 01Por qué cambió la factura de Datadog en 2026
  2. 02Datadog vs stack Prometheus / Grafana / Loki
  3. 03Los componentes de sustitución
  4. 04Migración en 6 pasos
  5. 05Requisitos previos y recursos VPS
  6. 06Lista de comprobación antes de empezar
  7. 07Lo que la stack autoalojada no hace
  8. 08Resolución de problemas frecuentes

Por qué cambió la factura de Datadog en 2026

Datadog factura por host, por GB de logs ingeridos y por span de APM. En 2026, las renovaciones incorporaron aumentos anuales del 5 al 10% en cada uno de estos ejes, y para los equipos que habían activado varios módulos (infraestructura, logs, APM, seguridad), el efecto acumulado produjo aumentos efectivos del 30 al 50% de una renovación a la siguiente.

El caso más citado es el de Gabriel Anhaia (dev.to, abril de 2026): un equipo cuya factura de Datadog superó los 50.000 $ anuales, desencadenando la auditoría que condujo a la migración a Prometheus + Grafana + Loki. Ahorro neto en licencias de software: 100%. Coste de sustitución: un VPS dedicado a la stack de observabilidad.

Datadog vs stack Prometheus / Grafana / Loki

Desplace la tabla

CriterioDatadogStack autoalojada
Coste de software15 a 150 $ / host / mes según módulos0 $ (licencias open source)
Coste de infraestructuraIncluido en la facturación99 DH/mes / mes (VPS 2 vCPU / 4 GB)
MétricasDatadog AgentPrometheus + Node Exporter
LogsDatadog Logs (por GB)Loki + Promtail (almacenamiento local)
DashboardsInterfaz Datadog integradaGrafana (miles de plantillas)
AlertasDatadog MonitorsAlertmanager + Grafana Alerting
APM / trazasDatadog APM (nativo)Tempo + OpenTelemetry (requiere configuración)
Correlación logs-métricasAutomáticaManual vía labels Loki / Prometheus
Mantenimiento opsNinguno (SaaS gestionado)A tu cargo (actualizaciones, almacenamiento)

Los componentes de sustitución

La stack cubre los tres pilares de la observabilidad: métricas (Prometheus), logs (Loki), y visualización + alertas (Grafana + Alertmanager). Para las trazas, Tempo completa el conjunto vía OpenTelemetry, pero es un cuarto componente, cubierto en el artículo opentelemetry-grafana-tempo-vps.

Prometheus recopila métricas por scraping HTTP: los exporters exponen endpoints /metrics, Prometheus los consulta a intervalos regulares y almacena las series temporales. Node Exporter sustituye al agente Datadog para métricas del sistema (CPU, RAM, disco, red). Loki almacena logs con un índice mínimo (solo labels, sin texto completo) — eso es lo que le permite funcionar con poca RAM. Promtail recopila archivos de logs y los envía a Loki, igual que el agente Datadog Logs. Grafana visualiza métricas de Prometheus y logs de Loki en los mismos dashboards. Alertmanager recibe alertas de Prometheus y las enruta hacia tus canales de notificación.

Migración en 6 pasos

  1. Instalar Prometheus y Node Exporter

    Empieza por las métricas del sistema: es el reemplazo más directo del agente Datadog. Despliega Prometheus y Node Exporter vía Docker Compose. El artículo installer-prometheus-vps cubre este paso en detalle. Verifica que Prometheus scrapee Node Exporter antes de continuar: abre http://tu-ip:9090/targets y confirma que el estado es UP. Deja ambos sistemas corriendo en paralelo al menos una semana antes de cortar Datadog.

  2. Desplegar Loki y Promtail

    Loki recibe los logs, Promtail los recopila desde los archivos de log de tu servidor. Añade ambos servicios a tu docker-compose.yml. Configura Promtail para apuntar a tus archivos de log (/var/log/syslog, logs de aplicación). Verifica la ingestión en Grafana (sección Explorer, fuente Loki) antes de desactivar la recopilación de logs en el agente Datadog.

  3. Configurar Grafana

    Grafana es el eje de la stack: conecta Prometheus (métricas) y Loki (logs) como fuentes de datos. Una vez añadidas ambas fuentes, importa dashboards de la comunidad desde grafana.com/grafana/dashboards — el dashboard Node Exporter Full (ID 1860) es la referencia para métricas del sistema. Recrea en Grafana los dashboards de Datadog que tu equipo consulta diariamente.

  4. Migrar las alertas a Alertmanager

    Exporta la lista de tus monitores Datadog (vía la API Datadog o la interfaz). Recrea las alertas críticas en Prometheus (reglas PrometheusRule) o en Grafana Alerting. Alertmanager gestiona el enrutamiento hacia tus canales de notificación: configura los receivers (email, Slack, PagerDuty) en alertmanager.yml.

  5. Validar en paralelo durante dos semanas

    No cortes Datadog hasta tener dos semanas de datos en tu stack autoalojada. Compara las métricas clave entre ambas fuentes. Dispara manualmente algunas alertas de prueba en Alertmanager. Verifica que Loki recibe correctamente los logs de producción.

  6. Cortar Datadog y recuperar la factura

    Una vez completada la validación, desactiva el agente Datadog en cada host, luego cancela los módulos Datadog en orden inverso de criticidad. Conserva los datos históricos de Datadog accesibles durante 30 días tras la cancelación — exporta dashboards y reportes críticos antes de ese plazo.

Requisitos previos y recursos VPS

La stack completa (Prometheus + Node Exporter + Loki + Promtail + Grafana + Alertmanager) funciona en un VPS de 2 vCPU / 4 GB RAM para supervisar de uno a cinco hosts con 15 días de retención de métricas. Esa es la configuración mínima recomendada: por debajo, Prometheus empieza a presionar bajo la carga de consultas de Grafana.

Para retención más larga (30 a 90 días) o volumen de logs alto (más de 10 GB al día), planifica 4 vCPU / 8 GB y un volumen de almacenamiento SSD adicional.

Software necesario: Docker y Docker Compose (versión reciente), un proxy inverso (Nginx o Caddy) para exponer Grafana por HTTPS, y un dominio o subdominio para Grafana. Abre solo el puerto HTTPS al exterior — Prometheus, Loki y Alertmanager no deben estar expuestos públicamente.

Lista de comprobación antes de empezar

  • VPS con al menos 2 vCPU / 4 GB RAM, con Docker y Docker Compose instalados.
  • Volumen de almacenamiento adicional dimensionado según la retención deseada (mínimo 15 GB para 30 días).
  • Lista completa de monitores Datadog activos, exportada antes de cualquier corte.
  • Lista de dashboards Datadog usados por el equipo, con capturas de pantalla de referencia.
  • Canales de notificación (Slack webhook, direcciones email, clave PagerDuty) disponibles para configurar Alertmanager.
  • Acceso de escritura a los archivos de log de aplicaciones en cada host supervisado (para Promtail).
  • Ventana de migración de dos semanas planificada con el equipo — la stack autoalojada corre en paralelo con Datadog durante este periodo.

Lo que la stack autoalojada no hace

Tres limitaciones que asumir antes de migrar.

Sin correlación APM nativa. Datadog correlaciona automáticamente una traza lenta con las métricas del host y los logs asociados. Con la stack open source, esta correlación se hace manualmente vía labels compartidos — es viable, pero requiere trabajo de configuración. Tempo + OpenTelemetry cubren el APM, pero añaden un cuarto componente a operar.

El mantenimiento es tu responsabilidad. Actualizaciones de Prometheus, Loki y Grafana, gestión del almacenamiento a medida que Loki crece, alertas sobre la propia stack. Presupuesta dos a cuatro horas al mes de operaciones rutinarias.

Interfaz menos integrada. Datadog es un producto único con UX unificada. La stack open source es un ensamblaje: Grafana para visualizar, Alertmanager para enrutar alertas, interfaces separadas para cada componente. Para un equipo habituado a Datadog, la adaptación lleva unos días.

Resolución de problemas frecuentes

Prometheus no scrapea Node Exporter. Verifica que la red Docker entre los dos contenedores es correcta (misma red Docker Compose) y que el puerto 9100 no está bloqueado por ufw. Abre http://node-exporter:9100/metrics desde dentro del contenedor Prometheus para confirmar la accesibilidad.

Loki recibe logs pero Grafana no muestra nada. La exploración de Loki en Grafana requiere un filtro de label mínimo — una consulta {} sin label devuelve un error de cuota. Usa {job="varlogs"} como punto de partida.

Grafana es lento en rangos de tiempo largos. Prometheus almacena las series temporales en memoria antes de escribirlas en disco. En un VPS de 2 GB RAM, limita la retención a 15 días y reduce la resolución con el parámetro step en los paneles de Grafana.

Alertmanager no envía notificaciones. Las alertas de Prometheus deben alcanzar el estado firing antes de ser enrutadas a Alertmanager. Comprueba la pestaña Alerts en la interfaz de Prometheus y confirma que las reglas de alerta están cargadas.

Despliega tu stack de observabilidad en un VPS

Un VPS VPS Start a 99 DH/mes es la base recomendada para la stack completa Prometheus + Grafana + Loki. Acceso root, IPv4 dedicada, almacenamiento SSD.

¿Necesita ayuda?

Consulte nuestro centro de ayuda y nuestra FAQ, o contacte con nuestro equipo: llamada, WhatsApp o correo electrónico. Soporte en francés, inglés y árabe.

Escribir por WhatsAppse abre en una pestaña nueva