Pour repousser les limites de contexte des modèles géants, la course à la mémoire physique semblait la seule issue. Pourtant, des gains de débit supérieurs à un facteur dix viennent d'être obtenus sur des MoE de 667 milliards de paramètres sans changer un seul composant. Et si le goulet d'étranglement de l'IA n'était pas dans le silicium, mais dans l'ordonnancement de nos calculs ?
#modeles #meta-evergreen #hardware #infrastructure #optimisation