Communauté SmartData

Automatiser la production de code DBT sans perdre la main sur la qualité.

Les modèles DBT s'écrivent encore souvent à la main, un par un. La communauté SmartData a mis au point une méthode pour générer modèles, tests et documentation avec l'IA, en laissant le dernier mot aux ingénieurs data.

4 min de lecture
DBTIA générativeAnalytics EngineeringCI/CDQualité des données
80 %des modèles automatisables avec des specs bien construites
+40 %de couverture de tests sur les modèles générés
x4sur la productivité des équipes
3 étapesanalyser, générer, valider

Un modèle de staging, puis un autre, puis un troisième. Mêmes renommages, mêmes jointures, mêmes tests. Le travail est maîtrisé, et c'est justement ce qui le rend si chronophage : il se répète à l'identique d'une table à l'autre.

01Le constat : un travail précieux, très répétitif

DBT a beaucoup simplifié la transformation des données dans l'entrepôt. Dans les équipes que nous accompagnons, la production des modèles reste pourtant largement artisanale. On retrouve presque toujours les mêmes points de friction.

Un code écrit à la mainLes modèles staging, intermediate et marts s'écrivent encore un par un.
Des patterns qui se répètentJointures, renommages et tests reviennent à l'identique d'une table à l'autre.
Des métiers qui attendentCette charge ralentit la mise à disposition de nouvelles données pour les équipes métier.
Des tests et une doc incompletsFaute de temps, la couverture de tests et la documentation restent souvent partielles.

02L'approche SmartData : partir des règles de gestion

Notre idée est simple : automatiser la production de code DBT à partir des schémas sources et des règles de gestion, en associant la génération assistée par IA aux bonnes pratiques d'ingénierie analytique. On décrit ce que le modèle doit faire, l'IA écrit le code qui correspond, et l'ingénieur data le relit.

De la spécification au modèle DBTExemple simplifié
spec_commandes.yml Entrée
source: erp.commandes
regle: montant_ttc = ht x (1 + tva)
cle: id_commande
convention: stg_, snake_case
stg_commandes.sql Sortie
select  id_commande,  montant_ht * (1 + taux_tva) as montant_ttcfrom {{ source('erp', 'commandes') }}-- tests : unique, not_null ✓
Modèle SQL généréTests associésDocumentation à jour
Une même spécification produit le modèle, ses tests et sa documentation, dans le respect des conventions de l'équipe.

Concrètement, voici ce que cette approche change au quotidien.

Une génération complète
Pour le code

Modèles SQL, tests et documentation sont produits automatiquement à partir d'une seule spécification.

Un ingénieur recentré
Pour les équipes

L'ingénieur data consacre son énergie à la logique métier et à la revue. La syntaxe répétitive est prise en charge pour lui.

Un socle homogène
Pour la plateforme

Conventions de nommage et patterns de tests s'appliquent partout, grâce à un harnais solide et à des contrôles systématiques.

L'IA écrit le code. L'ingénieur data décide de ce qui part en production.

03La méthode, en trois étapes

Le processus tient en trois temps. Chacun a son rôle, et le dernier reste entre les mains de l'équipe.

Aucun modèle n'arrive en production sans avoir été relu par un ingénieur data, même lorsqu'il respecte déjà toutes les règles définies.
De la spécification au pipeline : l'IA intervient au milieu, l'humain encadre le début et la fin.

04L'IA accélère, la gouvernance décide

L'IA accélère la production de code. La définition des règles de gestion, la revue humaine et l'intégration continue restent au cœur du processus, et c'est précisément ce qui rend ce gain de vitesse durable. Quatre enseignements ressortent de nos projets.

La qualité des specs fait toutLe résultat dépend directement de la clarté des spécifications et des schémas sources fournis en entrée. Une règle floue donnera un modèle flou.
Le time to value se réduitLes métiers accèdent plus rapidement à leurs données transformées.
La revue humaine reste systématiqueChaque modèle est relu avant sa mise en production, même lorsqu'il respecte les règles et les standards en place.
Le temps gagné se réinvestitIl part dans la modélisation métier, l'analyse des besoins, les performances globales et la qualité des données.
Ce que nous observons sur nos projets

Avec des spécifications bien construites, jusqu'à 80 % des modèles peuvent être automatisés. Les modèles générés gagnent 40 % de couverture de tests, et la productivité des équipes est multipliée par quatre.

Ntico Data & IA

Vous voulez accélérer votre time to value ?

Nos équipes Data et la communauté SmartData accompagnent déjà plusieurs clients sur ce sujet. Nous partons de vos schémas sources, de vos règles de gestion et de vos conventions pour mettre en place une production DBT plus rapide, testée et documentée.

Vous voulez savoir quelle part de vos modèles pourrait être automatisée ? Échangeons sur votre contexte.

Toutes les actualités