La facture d'observabilité est celle qui surprend deux fois. La première, quand elle arrive et qu'elle représente un tiers de la facture de calcul. La seconde, un an plus tard, quand elle est supérieure à la facture de calcul, parce que le calcul est devenu moins cher à l'unité à mesure que vous optimisiez, et que la télémétrie est devenue plus chère à l'unité à mesure que vous ajoutiez des tags.
Nous avons écrit sur le fait de garder les logs, les traces et les alertes neutres vis-à-vis du cloud. Cette série fait un argument architectural. Cet article fait l'argument financier, avec des chiffres, pour les trois façons dont vous pouvez réellement acheter le backend : un fournisseur tout-en-un, une pile open source hébergée, ou l'exploitation de la pile open source vous-même.
La charge de travail
Pour comparer ce qui est comparable, une seule charge, à l'échelle où la décision commence à compter :
| Signal | Volume | Notes |
|---|---|---|
| Logs | 100 Go / jour | JSON, ~3 To / mois, rétention 30 jours |
| Traces | 50 Go / jour après échantillonnage en fin de trace | ~1,5 To / mois, rétention 14 jours |
| Métriques | 300 000 séries temporelles actives | Collectées toutes les 15 s, rétention 13 mois |
| Hôtes | 40 | Un mélange de nœuds Kubernetes et de conteneurs |
C'est en gros un produit de taille moyenne avec quelques centaines de requêtes par seconde. Les petites équipes sont en dessous ; la plupart des entreprises avec une équipe plateforme sont au-dessus. La forme des conclusions tient aux deux extrémités ; les chiffres absolus évoluent presque linéairement.
Option 1 : un fournisseur tout-en-un
Datadog est la référence. Prix catalogue 2026, en gros, et tout gros client négocie 20 à 40 % de remise, donc prenez ces chiffres comme un plafond :
| Ligne | Prix unitaire | Mensuel |
|---|---|---|
| Ingestion de logs | ~0,10 $ / Go | 300 $ |
| Indexation des logs, 30 jours | ~2,50 $ / million d'événements (~2,5 Ko chacun → ~40 M d'événements / jour) | 3 000 $ |
| Hôtes APM | ~40 $ / hôte | 1 600 $ |
| Spans ingérés au-delà de l'allocation incluse | ~0,10 $ / Go (après 150 Go / hôte inclus) | ~0 $ à ce volume |
| Supervision d'infrastructure | ~23 $ / hôte | 920 $ |
| Métriques personnalisées au-delà des 100 / hôte incluses | ~5 $ / 100 métriques · 296 000 supplémentaires | ~1 500 $ |
| Total | ~7 300 $ |
La ligne d'indexation des logs domine, et c'est celle que personne n'attend : l'ingestion est bon marché, c'est pouvoir chercher qui coûte. La ligne des métriques personnalisées est la seconde surprise, parce que « personnalisé » signifie toute métrique qui ne vient pas d'une intégration de l'agent, c'est-à-dire chaque métrique applicative que vous émettez.
Ce que vous obtenez en échange est réel : un agent, une interface, chaque intégration déjà construite, la supervision de sécurité et le RUM à une case à cocher, et un contrat de support. Pour une équipe qui n'a personne pour exploiter de l'infrastructure, c'est tout l'intérêt.
Option 2 : open source hébergé
Grafana Cloud, qui héberge Loki, Tempo et Mimir avec le même modèle de données que vous exploiteriez vous-même. Prix catalogue, en gros :
| Ligne | Prix unitaire | Mensuel |
|---|---|---|
| Logs | ~0,50 $ / Go ingéré, 30 jours inclus | 1 500 $ |
| Traces | ~0,50 $ / Go ingéré, 14 jours inclus | 750 $ |
| Métriques | ~8 $ / 1 000 séries | 2 400 $ |
| Utilisateurs, alertes, tableaux de bord | inclus à ce palier | 0 $ |
| Total | ~4 650 $ |
Moins cher que le fournisseur d'environ un tiers, et l'écart se creuse avec le volume de logs parce qu'il n'y a pas de multiplicateur d'indexation. Les métriques sont le signal cher ici, à l'opposé du profil du fournisseur. Et il y a un coût non dit qui compte pour nous : nos données quittent le cloud du client et atterrissent chez le fournisseur, ce qui pour l'un de nos clients est un problème contractuel et pour un autre un problème de résidence des données.
Option 3 : auto-hébergé
Les trois mêmes composants sur notre propre calcul, dans le compte du client, écrivant dans du stockage objet. Les chiffres ci-dessous concernent un déploiement que nous exploitons réellement, à peu près à cette échelle, aux prix catalogue AWS :
| Ligne | Quoi | Mensuel |
|---|---|---|
| Loki | 3 × m6i.large (écriture, lecture, backend), ~70 $ chacun | 210 $ |
| Tempo | 2 × m6i.large | 140 $ |
| Mimir | 3 × r6i.large (beaucoup de mémoire), ~125 $ chacun | 375 $ |
| Grafana + alertes | 1 × t3.medium | 30 $ |
| Stockage objet | ~1,2 To de logs compressés + traces + blocs de métriques à 0,023 $ / Go | 30 $ |
| Équilibreur, EBS pour le WAL | 60 $ | |
| Total infrastructure | ~845 $ | |
| Exploitation | ~0,15 ETP : mises à jour, capacité, astreinte pour la pile elle-même | ~1 500–2 500 $ |
| Total | ~2 300–3 300 $ |
L'infrastructure est une erreur d'arrondi. La ligne honnête, c'est l'exploitation. Nous estimons 0,15 d'un ingénieur, soit à peu près une journée toutes les deux semaines : mettre à jour les trois composants, surveiller leurs propres tableaux de bord, ajuster la rétention et la compaction, et être la personne appelée quand c'est la pile d'observabilité qui est en panne. Ce chiffre est réel, et c'est celui que les fournisseurs ont raison de pointer. C'est aussi un chiffre qui ne grandit pas avec le volume : le dixième téraoctet par jour coûte les mêmes heures d'ingénieur que le premier.
Le point de croisement, et pourquoi il n'est pas là où vous croyez
À 10 Go par jour, le fournisseur coûte environ 1 200 $, l'open source hébergé environ 700 $, et l'auto-hébergé reste à 845 $ d'infrastructure plus le même coût d'exploitation, donc 2 500 $. L'auto-hébergement perd à petite échelle, clairement. Les 0,15 ETP sont un coût fixe, et à petit volume c'est toute la facture.
À 100 Go par jour, le tableau ci-dessus : l'auto-hébergé gagne d'un facteur deux à trois, et l'écart est surtout la ligne d'indexation des logs.
À 1 To par jour, le fournisseur est quelque part au-delà de 50 000 $ par mois après remises, l'open source hébergé autour de 30 000 $, et l'auto-hébergé environ 4 000 $ d'infrastructure et peut-être 0,3 ETP, donc moins de 10 000 $. À cette échelle, le coût d'exploitation a cessé d'être le sujet.
Le croisement se situe autour de 40 à 60 Go de logs par jour, plus bas que la plupart des gens ne l'imaginent. Il est plus bas parce que l'exploitation auto-hébergée n'évolue pas avec le volume, alors que la facturation d'indexation du fournisseur, si. Si vous êtes à 20 Go par jour et que vous croissez de 10 % par mois, vous le franchirez dans environ un an, et migrer des backends d'observabilité est un projet que vous préférez faire avant d'en avoir besoin.
Ce que le tableau ne montre pas
L'emplacement de vos données. L'auto-hébergé garde chaque ligne de log dans votre compte, dans votre région, sous votre clé KMS. Pour deux de nos clients ce n'est pas une préférence, c'est une exigence, et elle retire les options 1 et 2 de la table avant même qu'on parle de prix.
L'egress. Si vos charges sont sur un cloud et que le point d'ingestion du fournisseur est ailleurs, chaque gigaoctet paie l'egress en sortant. À 150 Go par jour de logs et de traces, c'est encore 400 $ par mois, et ça ne figure dans la liste de prix de personne.
L'enfermement, dans les deux sens. Le langage de requête, les tableaux de bord et les définitions d'alertes du fournisseur ne s'exportent pas. Ceux de la pile open source, si, qu'elle soit hébergée ou auto-hébergée : un JSON de tableau de bord Grafana et une règle d'alerte PromQL passent de Grafana Cloud à votre propre Grafana sans changement. C'est l'argument le plus fort pour l'option 2 face à l'option 1 même quand les prix sont proches : elle garde l'option 3 ouverte.
Les 0,15 ETP sont optimistes si personne ne veut le poste. Nous avons des gens qui aiment exploiter Loki. Si votre équipe n'en a pas, le coût d'exploitation n'est pas 0,15 ETP, c'est une pile en retard de six versions et une panne que personne ne comprend. Soyez honnête là-dessus avant de choisir l'option 3.
Ce que nous recommandons
- Sous environ 30 Go par jour, ou sans personne pour en être responsable : open source hébergé. Moins cher que le fournisseur, garde le modèle de données portable, pas d'exploitation.
- Au-dessus d'environ 50 Go par jour, avec quelqu'un qui veut l'exploiter : auto-hébergé, dans le cloud du client, sur du stockage objet. Budgétez explicitement les heures d'ingénieur et mettez-les sur la même table que la licence que vous n'avez pas achetée.
- Données réglementées ou résidence contractuelle : auto-hébergé, quel que soit le volume.
- Le fournisseur tout-en-un : quand vous paieriez la prime pour les intégrations et le support, et quand vous êtes assez petit pour que la prime soit inférieure à une personne. C'est un vrai segment, et ce n'est pas nous.
Les chiffres bougent chaque année ; la forme, non. L'indexation et la tarification par hôte croissent linéairement avec votre produit. Un ingénieur qui fait tourner trois binaires open source sur du stockage objet, non. Là où ces lignes se croisent pour vous, c'est votre point de décision, et il est probablement plus proche que vous ne le pensez.
Vous voulez la feuille de calcul avec vos propres volumes dedans ? Nous la remplirons avec vous.