Google vient de faire ce que personne n'attendait avec vos données Excel.
Vos modèles de prédiction coûtent cher. TabFM vient peut-être de rendre tout ça obsolète.
Chaque année, des milliers d'entreprises dépensent des budgets conséquents pour entraîner des modèles de machine learning sur leurs données tabulaires — ces fameuses feuilles Excel, bases CRM, tableaux financiers. Des mois de travail, des data scientists mobilisés, des infrastructures cloud qui tournent. Et si une seule approche, développée en silence chez Google, pouvait remplacer la majorité de ce travail en quelques minutes ? C'est exactement ce que promet TabFM, le modèle de fondation pour données tabulaires que Google DeepMind a commencé à dévoiler — et qui mérite qu'on s'y arrête sérieusement.
Le problème que personne ne voulait vraiment résoudre
Depuis l'explosion des grands modèles de langage (LLM) comme GPT ou Gemini, une question revenait en boucle dans les couloirs des équipes data : pourquoi ne fait-on pas la même chose pour les données structurées ?
La réponse était toujours la même : les données tabulaires sont trop hétérogènes. Chaque entreprise a ses propres colonnes, ses propres noms de variables, ses propres logiques métier. Contrairement au texte ou aux images, il n'existe pas de "langage universel" des tableaux. Entraîner un modèle généraliste semblait donc impossible — ou du moins, peu rentable.
Résultat : pendant que les LLM devenaient capables de tout comprendre, les équipes data continuaient à entraîner des modèles XGBoost ou Random Forest from scratch, dataset par dataset, projet par projet.
Ce que TabFM change fondamentalement
TabFM — pour Tabular Foundation Model — est une architecture entraînée sur des millions de jeux de données tabulaires provenant de sources variées : données publiques, benchmarks académiques, données synthétiques. L'idée centrale est simple à expliquer, mais difficile à exécuter :
- Pré-entraînement massif : le modèle apprend des patterns génériques à travers des milliers de tâches de prédiction différentes, avant même de voir vos données.
- Transfert de connaissance : lorsqu'on lui soumet un nouveau tableau, il mobilise ce qu'il a déjà appris pour faire des prédictions pertinentes, même avec très peu d'exemples.
- Few-shot et zero-shot : dans certains cas, TabFM peut faire des prédictions correctes sans aucun exemple d'entraînement spécifique à votre problème.
C'est ce dernier point qui change tout. Jusqu'ici, la règle d'or du machine learning était : plus de données = meilleur modèle. TabFM commence à remettre ce principe en question.
Des exemples concrets qui parlent à l'entreprise
Prenons trois cas d'usage typiques en entreprise :
1. Prédiction du churn client
Un modèle classique nécessite des mois d'historique, un feature engineering précis, et souvent un data scientist dédié. Avec une approche TabFM, vous soumettez votre tableau clients avec quelques dizaines d'exemples labellisés — et le modèle generalise. Les premiers tests publiés montrent des performances comparables aux meilleurs modèles entraînés from scratch, avec 10 à 100 fois moins de données.
2. Prévision des ventes
Les petites et moyennes entreprises n'ont souvent pas assez d'historique pour entraîner des modèles fiables. Un modèle de fondation pré-entraîné peut compenser ce manque de données en s'appuyant sur des patterns appris ailleurs — par exemple, des saisonnalités génériques ou des comportements d'achat transversaux.
3. Détection de fraude
Les cas frauduleux sont rares par définition, ce qui rend l'entraînement classique difficile. TabFM, entraîné sur des milliers de problèmes de classification déséquilibrée, arrive mieux équipé pour gérer cette rareté des exemples positifs.
Ce que ça implique pour votre organisation
TabFM n'est pas un outil clé en main disponible aujourd'hui pour tout le monde. C'est encore un domaine de recherche actif, avec des publications en cours et des benchmarks en évolution. Mais les implications stratégiques sont réelles et doivent être anticipées :
- Les projets data courts deviennent viables : des prédictions utiles en quelques heures plutôt que quelques mois.
- Le seuil d'entrée baisse drastiquement : les PME sans data scientists peuvent accéder à des performances autrefois réservées aux grandes entreprises.
- La valeur se déplace : si le modèle généraliste fait le gros du travail, la valeur ajoutée des équipes data se concentre sur la qualité des données, l'interprétabilité, et le cadrage des bons problèmes.
C'est ce dernier point qui inquiète — ou devrait inquiéter — certains profils techniques. Non pas parce que les emplois disparaissent, mais parce que les compétences qui comptent sont en train de changer.
Google joue une carte que ses concurrents n'ont pas encore
OpenAI a GPT. Anthropic a Claude. Google, lui, a quelque chose que ses concurrents n'ont pas à cette échelle : des décennies de données d'entreprise structurées, via Google Sheets, BigQuery, Workspace. TabFM s'inscrit dans une stratégie plus large où Google DeepMind cherche à dominer non pas le texte, mais la décision d'entreprise — cette couche où la donnée brute se transforme en action concrète.
La prochaine grande bataille de l'IA ne se jouera peut-être pas dans les chatbots. Elle se jouera dans vos fichiers Excel.
Conclusion : ce n'est pas une tendance à surveiller, c'est une bascule à préparer
TabFM représente quelque chose de rare dans l'IA appliquée : une avancée qui touche directement le quotidien des entreprises, sans nécessiter de compréhension profonde du machine learning pour en bénéficier. La promesse — faire des prédictions fiables avec peu de données, peu de temps, et peu d'expertise technique — est exactement ce dont des milliers d'organisations ont besoin.
La vraie question n'est pas de savoir si cette technologie va s'imposer. C'est de savoir si vous serez prêt à l'utiliser avant vos concurrents.
— Reservoir Live