Skip to content
Ce que coûte vraiment l'observabilité managée à 100 Go par jour : Datadog, Grafana Cloud, auto-hébergé
← ← Retour aux Réflexions Cloud

Ce que coûte vraiment l'observabilité managée à 100 Go par jour : Datadog, Grafana Cloud, auto-hébergé

La facture d'observabilité est celle qui surprend deux fois. La première, quand elle arrive et qu'elle représente un tiers de la facture de calcul. La seconde, un an plus tard, quand elle est supérieure à la facture de calcul, parce que le calcul est devenu moins cher à l'unité à mesure que vous optimisiez, et que la télémétrie est devenue plus chère à l'unité à mesure que vous ajoutiez des tags.

Nous avons écrit sur le fait de garder les logs, les traces et les alertes neutres vis-à-vis du cloud. Cette série fait un argument architectural. Cet article fait l'argument financier, avec des chiffres, pour les trois façons dont vous pouvez réellement acheter le backend : un fournisseur tout-en-un, une pile open source hébergée, ou l'exploitation de la pile open source vous-même.

La charge de travail

Pour comparer ce qui est comparable, une seule charge, à l'échelle où la décision commence à compter :

Signal Volume Notes
Logs 100 Go / jour JSON, ~3 To / mois, rétention 30 jours
Traces 50 Go / jour après échantillonnage en fin de trace ~1,5 To / mois, rétention 14 jours
Métriques 300 000 séries temporelles actives Collectées toutes les 15 s, rétention 13 mois
Hôtes 40 Un mélange de nœuds Kubernetes et de conteneurs

C'est en gros un produit de taille moyenne avec quelques centaines de requêtes par seconde. Les petites équipes sont en dessous ; la plupart des entreprises avec une équipe plateforme sont au-dessus. La forme des conclusions tient aux deux extrémités ; les chiffres absolus évoluent presque linéairement.

Option 1 : un fournisseur tout-en-un

Datadog est la référence. Prix catalogue 2026, en gros, et tout gros client négocie 20 à 40 % de remise, donc prenez ces chiffres comme un plafond :

Ligne Prix unitaire Mensuel
Ingestion de logs ~0,10 $ / Go 300 $
Indexation des logs, 30 jours ~2,50 $ / million d'événements (~2,5 Ko chacun → ~40 M d'événements / jour) 3 000 $
Hôtes APM ~40 $ / hôte 1 600 $
Spans ingérés au-delà de l'allocation incluse ~0,10 $ / Go (après 150 Go / hôte inclus) ~0 $ à ce volume
Supervision d'infrastructure ~23 $ / hôte 920 $
Métriques personnalisées au-delà des 100 / hôte incluses ~5 $ / 100 métriques · 296 000 supplémentaires ~1 500 $
Total ~7 300 $

La ligne d'indexation des logs domine, et c'est celle que personne n'attend : l'ingestion est bon marché, c'est pouvoir chercher qui coûte. La ligne des métriques personnalisées est la seconde surprise, parce que « personnalisé » signifie toute métrique qui ne vient pas d'une intégration de l'agent, c'est-à-dire chaque métrique applicative que vous émettez.

Ce que vous obtenez en échange est réel : un agent, une interface, chaque intégration déjà construite, la supervision de sécurité et le RUM à une case à cocher, et un contrat de support. Pour une équipe qui n'a personne pour exploiter de l'infrastructure, c'est tout l'intérêt.

Option 2 : open source hébergé

Grafana Cloud, qui héberge Loki, Tempo et Mimir avec le même modèle de données que vous exploiteriez vous-même. Prix catalogue, en gros :

Ligne Prix unitaire Mensuel
Logs ~0,50 $ / Go ingéré, 30 jours inclus 1 500 $
Traces ~0,50 $ / Go ingéré, 14 jours inclus 750 $
Métriques ~8 $ / 1 000 séries 2 400 $
Utilisateurs, alertes, tableaux de bord inclus à ce palier 0 $
Total ~4 650 $

Moins cher que le fournisseur d'environ un tiers, et l'écart se creuse avec le volume de logs parce qu'il n'y a pas de multiplicateur d'indexation. Les métriques sont le signal cher ici, à l'opposé du profil du fournisseur. Et il y a un coût non dit qui compte pour nous : nos données quittent le cloud du client et atterrissent chez le fournisseur, ce qui pour l'un de nos clients est un problème contractuel et pour un autre un problème de résidence des données.

Option 3 : auto-hébergé

Les trois mêmes composants sur notre propre calcul, dans le compte du client, écrivant dans du stockage objet. Les chiffres ci-dessous concernent un déploiement que nous exploitons réellement, à peu près à cette échelle, aux prix catalogue AWS :

Ligne Quoi Mensuel
Loki 3 × m6i.large (écriture, lecture, backend), ~70 $ chacun 210 $
Tempo 2 × m6i.large 140 $
Mimir 3 × r6i.large (beaucoup de mémoire), ~125 $ chacun 375 $
Grafana + alertes 1 × t3.medium 30 $
Stockage objet ~1,2 To de logs compressés + traces + blocs de métriques à 0,023 $ / Go 30 $
Équilibreur, EBS pour le WAL 60 $
Total infrastructure ~845 $
Exploitation ~0,15 ETP : mises à jour, capacité, astreinte pour la pile elle-même ~1 500–2 500 $
Total ~2 300–3 300 $

L'infrastructure est une erreur d'arrondi. La ligne honnête, c'est l'exploitation. Nous estimons 0,15 d'un ingénieur, soit à peu près une journée toutes les deux semaines : mettre à jour les trois composants, surveiller leurs propres tableaux de bord, ajuster la rétention et la compaction, et être la personne appelée quand c'est la pile d'observabilité qui est en panne. Ce chiffre est réel, et c'est celui que les fournisseurs ont raison de pointer. C'est aussi un chiffre qui ne grandit pas avec le volume : le dixième téraoctet par jour coûte les mêmes heures d'ingénieur que le premier.

Coût mensuel à 100 Go / jour de logs · 50 Go / jour de traces · 300k séries fournisseur tout-en-un ~7 300 $ indexation des logs 3 000 $hôtes APM + infra 2 500 $métriques personnalisées 1 500 $ open source hébergé ~4 650 $ métriques 2 400 $logs 1 500 $traces 750 $ auto-hébergé ~2 800 $ exploitation ~2 000 $infrastructure 845 $ La partie verte est plate avec le volume. Les barres rouge et jaune y sont linéaires.

Le point de croisement, et pourquoi il n'est pas là où vous croyez

À 10 Go par jour, le fournisseur coûte environ 1 200 $, l'open source hébergé environ 700 $, et l'auto-hébergé reste à 845 $ d'infrastructure plus le même coût d'exploitation, donc 2 500 $. L'auto-hébergement perd à petite échelle, clairement. Les 0,15 ETP sont un coût fixe, et à petit volume c'est toute la facture.

À 100 Go par jour, le tableau ci-dessus : l'auto-hébergé gagne d'un facteur deux à trois, et l'écart est surtout la ligne d'indexation des logs.

À 1 To par jour, le fournisseur est quelque part au-delà de 50 000 $ par mois après remises, l'open source hébergé autour de 30 000 $, et l'auto-hébergé environ 4 000 $ d'infrastructure et peut-être 0,3 ETP, donc moins de 10 000 $. À cette échelle, le coût d'exploitation a cessé d'être le sujet.

Coût mensuel vs volume de logs (échelle log) 10 Go/j100 Go/j1 To/j 500 $5k $50k $ fournisseur OSS hébergé auto-hébergé croisement · ~50 Go/j Sous ~50 Go/jour, payez quelqu'un. Au-dessus, le coût fixe d'exploitation est moins cher que le coût linéaire du fournisseur.

Le croisement se situe autour de 40 à 60 Go de logs par jour, plus bas que la plupart des gens ne l'imaginent. Il est plus bas parce que l'exploitation auto-hébergée n'évolue pas avec le volume, alors que la facturation d'indexation du fournisseur, si. Si vous êtes à 20 Go par jour et que vous croissez de 10 % par mois, vous le franchirez dans environ un an, et migrer des backends d'observabilité est un projet que vous préférez faire avant d'en avoir besoin.

Ce que le tableau ne montre pas

L'emplacement de vos données. L'auto-hébergé garde chaque ligne de log dans votre compte, dans votre région, sous votre clé KMS. Pour deux de nos clients ce n'est pas une préférence, c'est une exigence, et elle retire les options 1 et 2 de la table avant même qu'on parle de prix.

L'egress. Si vos charges sont sur un cloud et que le point d'ingestion du fournisseur est ailleurs, chaque gigaoctet paie l'egress en sortant. À 150 Go par jour de logs et de traces, c'est encore 400 $ par mois, et ça ne figure dans la liste de prix de personne.

L'enfermement, dans les deux sens. Le langage de requête, les tableaux de bord et les définitions d'alertes du fournisseur ne s'exportent pas. Ceux de la pile open source, si, qu'elle soit hébergée ou auto-hébergée : un JSON de tableau de bord Grafana et une règle d'alerte PromQL passent de Grafana Cloud à votre propre Grafana sans changement. C'est l'argument le plus fort pour l'option 2 face à l'option 1 même quand les prix sont proches : elle garde l'option 3 ouverte.

Les 0,15 ETP sont optimistes si personne ne veut le poste. Nous avons des gens qui aiment exploiter Loki. Si votre équipe n'en a pas, le coût d'exploitation n'est pas 0,15 ETP, c'est une pile en retard de six versions et une panne que personne ne comprend. Soyez honnête là-dessus avant de choisir l'option 3.

Ce que nous recommandons

  • Sous environ 30 Go par jour, ou sans personne pour en être responsable : open source hébergé. Moins cher que le fournisseur, garde le modèle de données portable, pas d'exploitation.
  • Au-dessus d'environ 50 Go par jour, avec quelqu'un qui veut l'exploiter : auto-hébergé, dans le cloud du client, sur du stockage objet. Budgétez explicitement les heures d'ingénieur et mettez-les sur la même table que la licence que vous n'avez pas achetée.
  • Données réglementées ou résidence contractuelle : auto-hébergé, quel que soit le volume.
  • Le fournisseur tout-en-un : quand vous paieriez la prime pour les intégrations et le support, et quand vous êtes assez petit pour que la prime soit inférieure à une personne. C'est un vrai segment, et ce n'est pas nous.

Les chiffres bougent chaque année ; la forme, non. L'indexation et la tarification par hôte croissent linéairement avec votre produit. Un ingénieur qui fait tourner trois binaires open source sur du stockage objet, non. Là où ces lignes se croisent pour vous, c'est votre point de décision, et il est probablement plus proche que vous ne le pensez.

Vous voulez la feuille de calcul avec vos propres volumes dedans ? Nous la remplirons avec vous.