Une facture de plateforme data est une décision d’ingénierie lue à l’envers. Tailles d’instances, classes de stockage, facteurs de réplication, largeur d’erasure coding, fenêtres de rétention, trafic sortant : chaque ligne a un responsable et une raison. Consultant indépendant, je remonte de la facture aux choix qui la produisent, je priorise le gaspillage et je garde la marge qui mérite d’être payée.
Point de preuve : audits d’infrastructure GPU où la capacité allouée dépassait largement l’utilisation mesurée ; charges de stockage objet où l’erasure coding multipliait silencieusement les petits fichiers. Références disponibles sous NDA.
Ce que la revue examine
L’utilisation mesurée face à la capacité allouée, le calcul d’abord. Puis le stockage : classes et politique de tiering, surcoût de réplication et d’erasure coding, la pénalité des petits fichiers qui multiplie métadonnées et trafic de réparation, doublons de sauvegarde et de continuité, trafic inter-zones et sortant, lignes de licence et de support. Chaque coût est relié au choix d’ingénierie qui le produit, pour que la correction soit une décision, pas une négociation de remise.
Livrables
Une liste de gaspillages priorisée : chaque ligne avec son coût mesuré, la modification qui la supprime et le scénario de panne qu’elle ne touche pas. Un modèle de capacité qui sépare gaspillage et marge, projetés à 3 et 5 ans, pour que l’économie survive à la croissance. Quand un dimensionnement couvre déjà le terrain, ses mesures alimentent celle-ci. Références disponibles sous NDA.
La revue est diagnostique : je ne vends ni mise en œuvre, ni licence, ni matériel, donc rien dans les conclusions ne dépend de ce que vous achetez ensuite.
FAQ
Comment distinguez-vous gaspillage et marge ?
La marge est l’utilisation qu’un scénario de panne va consommer : réplication, copies de continuité, marge de pic. Le gaspillage est la capacité qu’aucun scénario du modèle de panne n’utiliserait jamais. Les deux sont mesurés face à vos scénarios documentés, pour que supprimer le second n’affaiblisse jamais le premier.
L’optimisation des coûts réduit-elle la fiabilité ?
Pas si la priorisation est honnête : la redondance qui achète de la tolérance aux pannes est chiffrée et conservée, la duplication qui n’achète rien est supprimée. Chaque recommandation nomme le scénario de panne qu’elle couvre encore, et ceux qu’elle ne couvre plus, pour que l’arbitrage soit explicite avant toute coupure.