Datadog vs Grafana: Der richtige Observability Stack?
Zusammenfassung
Datadog vs Grafana läuft auf die Frage hinaus, wer den Schmerz trägt. Datadogs Pro-Host-Agent liefert ein funktionierendes Dashboard in Minuten und kombiniert es mit einem KI-Agenten, der Abhilfe vorschlägt, aber die Rechnung wird schnell teuer, wenn man über etwa 50 Hosts hinausgeht. Grafanas kostenlose Stufe und der Open-Source-LGTM-Stack halten die Kosten vorhersehbar und vermeiden Vendor Lock-in, falls dein Team die Bandbreite hat, Prometheus, Loki und Tempo selbst zu betreiben. Dieser Vergleich schlüsselt Preismodelle, den SLO-to-Alert-Workflow, das Deployment-Modell und Incident-Automation mit echten Zahlen auf, nicht mit ungeprüften Vendor-Aussagen.

Datadog
- Agent-Auto-Discovery liefert Infra-, APM- und Log-Dashboards innerhalb von Minuten nach Installation, kein Backend-Assembly nötig
- Bits AI SRE Agent sammelt automatisch Kontext bei Trigger und schlägt Abhilfe-Schritte während eines Incidents vor
- Eine Query-Sprache und eine UI über Infra, APM, Logs, RUM und Synthetics reduziert Context-Switching während eines On-Call-Shifts
- Pro-Host plus Pro-Signal-Abrechnung compound schnell, sobald eine Fleet über etwa 50 Hosts hinaus wächst, besonders mit überall aktiviertem APM
- Custom Metrics und High-Cardinality Tags werden als separate Rechnungsposten berechnet und sind die häufigste Quelle für Überraschungs-Rechnungen
- SaaS-only-Preismodell bedeutet, es gibt keinen selbstgehoстeten Escape Hatch, wenn die Rechnung zu einem Budget-Gespräch mit Finance wird
Am besten, wenn du für Geschwindigkeit zum funktionierenden Dashboard und schnellere Incident-Triage zahlen willst.

Grafana
- Free Forever Tier deckt 10.000 aktive Metriken-Series und 50GB Logs unbegrenzt ab, ohne laufende Trial-Uhr
- Open-Source-LGTM-Stack (Grafana, Loki, Tempo, Mimir) läuft vollständig selbstgehostet mit nur Infrastruktur-Kosten, ohne Vendor Lock-in
- SLO-Definitionen und ihre Alert-Regeln leben im selben Objekt, also kann das Rollout-Gate nicht stille vom Dashboard abweichen
- Selbsthosting bedeutet Installation, Betrieb und Upgrades von Prometheus, Loki und Tempo selbst, bevor ein einzelnes Dashboard existiert
- Kein nativer KI-Incident-Abhilfe-Agent; Adaptive Telemetry zielt auf Signal-Kostenreduzierung, nicht auf MTTR-Reduzierung
- Korrelation von Metriken zu Traces zu Logs über den LGTM-Stack erfordert mehr manuelle Verdrahtung als ein Single-Vendor-Agent macht
Am besten, wenn dein Team bereits Prometheus betreibt und Kontrolle über die Rechnung und das Backend haben will.
At-a-glance
| Datadog | Grafana | |
|---|---|---|
| Preismodell | $15-23/Host/Mo (Infra) + $31/Host/Mo (APM) + $0,10/GB indizierte Logs + Event-basierte Erfassungsgebühr | Kostenlos bis 10K aktive Series / 50GB Logs; Pro fügt $19/Mo + $6,50 pro 1K Series + $0,40/GB Logs hinzu |
| Kosten bei ca. 100 Hosts | Häufig $5K-15K/Mo, sobald APM, Logs und Custom Metrics sich oben auf Infra-Monitoring stapeln | Skaliert mit aktiven Series und GB erfasst, nicht mit Host-Anzahl; selbstgehostet LGTM begrenzt Kosten auf Infrastruktur-Spend |
| Deployment-Modell | Nur SaaS, keine selbstgehostete Option, Daten verlassen dein VPC absichtlich | Verwaltete Grafana Cloud oder vollständig selbstgehostet Open-Source-LGTM-Stack (Loki, Tempo, Mimir) |
| SLO-zu-Alert-Workflow | SLO und Monitor sind separate Objekte; die Alert-Regel ist als zweiter Schritt verdrahtet | SLO-Definition und ihre Alert-Regel leben im selben Objekt, also kann das Gate nicht stille auseinanderdriften |
| Incident-Response-Automatisierung | Bits AI SRE Agent schlägt Abhilfe bei Trigger vor (Vendor-berichtet MTTR: 45 Min. auf unter 10 Min. bei wiederholten Mustern) | Adaptive Telemetry zielt auf Signal-Kostenreduzierung, nicht auf Incident-Abhilfe; kein nativer KI-Triage-Agent |
| Zeit zum ersten funktionierenden Dashboard | Minuten: Agent ermöglicht Auto-Discovery von Hosts und Services, Dashboards befüllen sich sofort | Stunden bis Tage: Du baust das Prometheus/Loki/Tempo-Backend zusammen, bevor das erste Panel rendert |
Verdict
Datadog gewinnt diesen Vergleich für Platform-Teams über etwa 50 Engineers, die ein Rollout-Gate brauchen, das schnell die richtige Person benachrichtigt: Der Agent liefert funktionsfähige Dashboards in Minuten und Bits AI verkürzt Triage bei wiederholten Incident-Mustern. Grafana gewinnt bei Kosten und Kontrolle: Teams, die bereits Prometheus betreiben und den LGTM-Stack selbst betreiben können, halten die Rechnung vorhersehbar und nichts ist proprietär. Wähle Datadog für Geschwindigkeit zum Signal. Wähle Grafana, wenn dein Team die SRE-Bandbreite hat, das Backend selbst zu betreiben, und die CFO liest den Observability-Posten jedes Quartal.
How we tested
Wir verglichen die veröffentlichten Preislisten jedes Vendors (Datadog und Grafana Cloud, August 2026 überprüft), Vendor-Dokumentation zu SLO- und Alerting-Konfiguration, und Third-Party-Kostenmodellierungs-Posts, cross-checked gegen die Dokumentation beider Vendors. Wir führten keine parallele Production-Deployment für dieses Stück durch; die MTTR-Zahlen, die Bits AI SRE Agent zugeschrieben werden, sind Vendor-berichtete Case-Study-Behauptungen, nicht Zahlen, die wir unabhängig gemessen haben, und wir haben sie als solche gekennzeichnet, anstatt sie als unsere eigenen Tests auszugeben. Homepage-Screenshots sind unsere eigenen Captures der öffentlichen Marketing-Sites jedes Vendors, die im August 2026 aufgenommen wurden, unbearbeitet.
Es ist 02:14 Uhr. Der Checkout p99 Latenz hat soeben 800ms überschritten, und PagerDuty kümmert nicht, dass du vor einer Stunde einen Canary deployed hast. Das ist die echte Datadog vs Grafana Frage: nicht welche Lösung mehr Integrationen hat, sondern welche einen müden Engineer vom Alert zur Root-Cause schneller bringt.
Verdict: Datadog gewinnt diese Runde für Teams, die einen Single Vendor und ein funktionierendes Dashboard vor dem Mittagessen wollen. Der Agent ermöglicht Auto-Discovery, und Bits AI SRE Agent schlägt Abhilfe vor, wenn ein Alert feuert. Grafana gewinnt beim Kostenmanagement und bei Vermeidung von Vendor Lock-in, falls dein Platform-Team bereits Prometheus betreibt und das Backend selbst betreiben kann.
Wir haben beide gegen veröffentlichte Preislisten getestet (August 2026 überprüft), Vendor-Dokumentation zum SLO- und Alerting-Workflow, und unsere eigene Lektüre der Homepages und Dokumentationen beider Produkte. Datadog gewinnt diese Runde für Teams, die einen einzelnen Vendor und ein funktionierendes Dashboard vor Mittag brauchen: Der Agent ermöglicht Auto-Discovery von Services, und Bits AI SRE Agent schlägt Abhilfe vor, wenn ein Alert feuert. Grafana gewinnt beim Kostenmanagement und bei vermeidung von Lock-in, wenn dein Platform-Team bereits Prometheus betreibt und das Backend selbst betreiben kann.
Was tatsächlich die Rechnung veränderte
Datadogs Preismodell für Infrastructure Monitoring beginnt bei $15/Host/Monat im Pro-Plan (Jahresabrechnung) oder $23/Host/Monat im Enterprise-Plan. Das ist, bevor APM hinzukommt, das separat mit $31/Host/Monat berechnet wird. Log Management addiert $0,10/GB für indizierte Logs plus etwa $1,27 bis $1,70 pro Million erfasste Events. Keine dieser Zahlen ist die echte Rechnung. Die echte Rechnung ist, was passiert, wenn ein Team Custom Metrics und High-Cardinality Tags hinzufügt, beide werden als separate Rechnungsposten abgerechnet, beide sind die häufigste Quelle von Finanzabteilungen, die im Oktober unangenehme Fragen stellen.
Grafanas kostenlose Stufe deckt 10.000 aktive Metriken-Series, 50GB Logs, 50GB Traces und 50GB Profile pro Monat ab, unbegrenzt, keine Kreditkarte erforderlich. Darüber hinaus fügt Pro eine $19/Monat Plattformgebühr plus $6,50 pro 1.000 abrechenbare Series, $0,40/GB zum Schreiben von Logs (plus $0,05/GB zum Verarbeiten und $0,10/GB zum Speichern) und eine ähnliche gestaffelte Rate für Traces hinzu. Der Open-Source-LGTM-Stack (Grafana, Loki, Tempo, Mimir) kann auch vollständig selbst gehostet werden, was den Observability-Posten in deiner Infrastruktur-Rechnung umwandelt, die du bereits kontrollierst, anstatt in eine Vendor-Rechnung, die mit ungeplanter Nutzung wächst.
Keines der beiden Modelle ist objektiv billiger. Datadogs Pro-Host-Preismodell ist vorhersehbar, wenn deine Host-Anzahl stabil und niedrig ist; es wird teuer, genau dann wenn du über die Größe hinauswächst, bei der ein einzelnen Vendors Praktikabilität am meisten zählt. Grafanas nutzungsbasierte Preismodell skaliert mit Signalvolumen, nicht mit Host-Anzahl, was Teams belohnt, die aktiv Kardinalität managen, und Teams bestraft, die das nicht tun.
Wer kontrolliert den Rollout: SLO zu Alert im Vergleich
Wenn du SLO-gesteuerte Rollouts betreibst (Canary oder anders), ist der Workflow, der zählt: SLO definieren, Alert definieren, der feuert, wenn das Error-Budget zu schnell verbraucht wird, diesen Alert an das Ding verdrahten, das den Deploy hält. Bei Grafana leben das SLO-Objekt und seine Alarm-Regel zusammen: definiere eins, das andere konfiguriert sich selbst daneben, also kann das Gate nicht stille aus Sync mit dem Dashboard gehen. Bei Datadog sind ein SLO und ein Monitor separate Objekte. Du musst immer noch den Alert als zweiten Schritt verdrahten, was funktioniert, aber es ist ein weiterer Platz für Gate und Dashboard, um nach einer Bearbeitung desynchron zu gehen.
Keiner dieser Unterschiede ist tödlich. Aber wenn deine Rollout-Tools eine SLO-Burn-Rate lesen, um zu entscheiden, ob du weiter versenden sollst, frag, welche Plattform diese Zahl und ihren Alert am selben Ort hält, bevor du gegen sie entwickelst.
Die KI-Incident-Frage
Datadogs Bits AI SRE Agent sammelt automatisch Kontext, wenn ein Alert feuert, und schlägt Abhilfe-Schritte vor. Datadogs eigene Case-Studien behaupten, dass dadurch die mittlere Zeit zur Auflösung von 45 Minuten auf unter 10 Minuten bei wiederholten Fehlermustern reduziert wurde. Wir haben diesen Vergleich nicht selbst durchgeführt, und eine Vendor-Fallstudie ist keine kontrollierte Studie, also behandle diese Zahl als Behauptung, nicht als Messung, bis du sie gegen deine eigenen Incidents protokolliert hast.
Grafanas nächstgelegenes Feature, Adaptive Telemetry, zielt darauf ab, die Kosten durch Löschen von Low-Value-Signal zu reduzieren, bevor es abgerechnet wird, nicht um während eines aktiven Incidents Abhilfe vorzuschlagen. Falls KI-unterstützte Triage der entscheidende Faktor für dein Team ist, hat Datadog derzeit das reifere Angebot hier. Das ist eine Dimension, bei der die Lücke real ist, nicht Marketing.
Deployment-Modell: SaaS-only vs selbstgehostet
Datadog ist SaaS-only. Es gibt keinen selbstgehoстeten Escape Hatch, falls die Rechnung ein politisches Problem wird, oder falls dein Security-Team verlangt, dass Daten niemals dein VPC verlassen. Grafana liefert sowohl ein verwaltetes Cloud-Produkt als auch einen vollständig Open-Source-Stack, den du selbst auf Prometheus, Loki und Tempo betreiben kannst. Diese Flexibilität ist nicht kostenlos: Das Aufstellen und Betreiben dieses Stacks ist echte Infrastrukturarbeit, und "kostenlos" Software kostet immer noch die Engineer-Hours, um sie gut zu betreiben. Teams, die bereits Prometheus für Metriken betreiben, bekommen Grafanas Dashboarding-Layer nahezu kostenlos. Teams, die von Null anfangen, wählen zwischen der Bezahlung an einen Vendor und der Bezahlung ihrer eigenen Teams Zeit.
Wo jedes Tool dich zuerst wehtut
Datодogs Fehlermodus zeigt sich auf der Finanzseite: Ein Team schaltet APM und Log-Indexierung überall an, weil es nur eine Checkbox ist, und sechs Monate später erinnert sich niemand, welche Services tatsächlich Trace-Level-Detail brauchten. Die Lösung ist langweilig und unglamourös: Beschriften du einen Cost Owner pro Service und überprüfe die Pro-Produkt-Zusammenfassung monatlich, bevor die Rechnung eine Überraschung statt einer Entscheidung wird.
Grafanas Fehlermodus zeigt sich auf der Ops-Seite: Der LGTM-Stack selbst wird zu einer On-Call-Last. Prometheus läuft aus Memory bei einem Kardinalitäts-Spike, oder Loki fällt während eines Traffic-Anstiegs hinter der Erfassung zurück, sind jetzt Incidents in deiner eigenen Infrastruktur, nicht Tickets, die du bei einem Vendor einreichst. Falls dein Platform-Team bereits dünn gesät ist, das ist echte Kosten, auch wenn die Rechnung null sagt.
Der ehrliche Tradeoff
Datadog ist die bessere Wahl, wenn Geschwindigkeit zum funktionierenden Dashboard und schnellere Incident-Triage das Bezahlen wert sind, und wenn ein einzelner Vendor, der Infra, APM, Logs und Synthetics abdeckt, die Bequemlichkeits-Steuer wert ist. Grafana ist die bessere Wahl, wenn dein Team bereits Prometheus und OpenTelemetry betreibt, wenn vorhersehbare Rechnungen wichtiger sind als durchdachte Eleganz, und wenn die Vermeidung von Vendor Lock-in ein echter Anforderung, nicht einfach eine Präferenz in einem Planungsdokument ist.
Kein Tool macht ein schlechtes SLO richtig. Keines sagt dir, welches Error-Budget tatsächlich für deine User zählt, falls es vorher niemand definiert hat. Wähle das Backend, das zum Team passt, das du tatsächlich hast, nicht das mit der besseren Homepage.