Meta détaille l’infrastructure utilisée pour entraîner GEM, son modèle fondation de recommandation publicitaire. Le système combine plusieurs milliers de GPU récents, des milliers de milliards de paramètres d’embedding clairsemés et des milliards de paramètres denses. L’intérêt technique dépasse la publicité : il montre comment adapter les méthodes des grands modèles de langage à des données où utilisateurs, objets et événements occupent une place centrale.
La réponse rapide
| Question | Réponse |
|---|---|
| GEM est-il un chatbot ? | Non. Il prédit et classe des recommandations publicitaires. |
| Pourquoi autant d’embeddings ? | Ils représentent les nombreuses identités et interactions discrètes du système. |
| Quel rendement Meta annonce-t-il ? | 20 à 25 % de MFU, après un doublement de l’efficacité de bout en bout. |
| Les résultats sont-ils indépendants ? | Non. Les chiffres et comparaisons proviennent de Meta. |
| Quelles idées sont réutilisables ? | Profilage bout en bout, précision réduite, communication adaptée et parallélisme topology-aware. |
Un modèle hybride très différent d’un LLM classique
Un LLM manipule surtout des couches denses et des séquences de tokens. Un système de recommandation doit également représenter un nombre immense d’utilisateurs, annonces, catégories et interactions. GEM associe donc une partie dense de plusieurs milliards de paramètres à une table clairsemée atteignant des milliers de milliards.
Cette structure déplace le goulot d’étranglement. Les opérations ne sont pas seulement du calcul matriciel ; elles incluent des accès irréguliers aux embeddings et des communications importantes entre GPU. Ajouter des accélérateurs sans repenser le placement peut augmenter l’attente plus vite que le débit.
Attention et communication optimisées ensemble
Meta décrit des noyaux personnalisés comme JFA, GDPA et BlockAttention pour mieux exploiter la forme des données de recommandation. Son implémentation GDPA serait deux fois plus rapide en forward et 1,6 fois en backward que sa base précédente, avec jusqu’à 3,5 fois de gain face à FA4 dans certains cas de clés et valeurs courtes.
Ces comparaisons sont propres aux charges et au matériel de Meta. Elles illustrent néanmoins une règle utile : choisir un noyau parce qu’il domine un benchmark LLM standard peut être une erreur lorsque les séquences et la parcimonie diffèrent.
Le parallélisme est organisé sur cinq dimensions en tenant compte de la topologie. La partie dense, les embeddings et les communications ne doivent pas traverser les mêmes liens de la même manière. Le placement devient une composante de l’algorithme.
La faible précision comme stratégie système
GEM utilise notamment MXFP8 afin de réduire mémoire et communication tout en maintenant la qualité nécessaire. La précision réduite ne se limite pas à changer un type : il faut définir où conserver davantage de précision, comment mettre à l’échelle les blocs et comment détecter les dérives numériques.
Meta affirme avoir doublé l’efficacité de bout en bout pour atteindre 20 à 25 % de MFU, tout en multipliant par quatre les FLOPs du modèle en douze mois. Le MFU mesure l’usage effectif du potentiel théorique des accélérateurs ; un score qui paraît faible peut être significatif sur un modèle dominé par les communications et les accès clairsemés.
Les leçons pour une infrastructure plus modeste
Peu d’équipes entraîneront un modèle de cette taille, mais la méthode est transposable. Mesurez séparément calcul, données et réseau. Optimisez le chemin dominant plutôt que le noyau le plus visible. Testez la précision réduite sur une métrique métier et placez les données selon la topologie réelle.
Une autre leçon concerne le coût. Quadrupler les FLOPs n’est utile que si le gain de recommandation justifie énergie, matériel et complexité. Les métriques d’infrastructure doivent rester reliées à un résultat produit.
GEM montre que les modèles de recommandation absorbent les techniques des LLM sans devenir des LLM. Leur difficulté spécifique reste l’union d’un calcul dense, d’une mémoire clairsemée gigantesque et d’un réseau qui doit alimenter les deux.




La discussion
Commentaires
Chargement des commentaires…