LiquidAI lance des IA plus légères sans perdre en qualité
D'après Hugging Face (19 août 2026 à 15h48)
Résumé
LiquidAI dévoile des checkpoints LFM2.5 en 4 bits issus de la distillation quantization-aware, qui maintiennent jusqu’à près de 97 % des performances BF16 sur des tâches de raisonnement et d’agenticité.
Les faits
LiquidAI annonce la mise à disposition de nouveaux checkpoints QAD Q4_0 au format GGUF pour quatre modèles de la famille LFM2.5 : LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct et LFM2.5-2.6B. Ces modèles peuvent désormais être exécutés en quantification 4 bits tout en visant un niveau de mémoire et de vitesse Q4_0, sans la dégradation de qualité habituellement associée à ce type de compression. Pour évaluer ces nouveaux checkpoints, LiquidAI compare leurs performances à celles de GGUF produits par une quantification post-entraînement classique. Les modèles sont testés sur un ensemble de benchmarks couvrant le raisonnement, le suivi d’instructions, l’usage d’outils et des capacités dites « agentiques » : GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF et BFCLv4. Des évaluations mathématiques à l’échelle adaptée complètent la batterie de tests : GSM8K pour LFM2.5-230M et LFM2.5-350M, AIME25 pour LFM2.5-1.2B-Instruct et LFM2.5-2.6B. Les résultats montrent que, sur l’ensemble des quatre modèles, la distillation quantization-aware améliore de façon nette les checkpoints Q4_0. Les versions QAD conservent respectivement 97,1 %, 96,5 %, 97,4 % et 96,6 % des performances de leurs références BF16, qui servent de plafond dans le même format GGUF. Les auteurs indiquent qu’ils rapportent la moyenne obtenue sur cinq répétitions des évaluations. Au-delà de la précision, LiquidAI met également l’accent sur la vitesse de décodage et la taille des modèles en conditions réelles d’exécution en périphérie. Les quatre modèles LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct et LFM2.5-2.6B sont profilés sur quatre matériels cibles : un MacBook Pro, un NucBox EVO-X2, un Samsung Galaxy S26 Ultra et un Raspberry Pi 5. Les mesures distinguent les scénarios d’inférence GPU pour le MacBook Pro et le NucBox, et les scénarios d’inférence CPU Arm pour le smartphone Samsung et le Raspberry Pi, avec des références en pleine précision BF16 et F16 affichées lorsque ces profils sont disponibles.
Pourquoi c’est important
Cette publication marque une étape significative pour l’exécution de modèles LFM2.5 en quantification 4 bits sur des matériels contraints, en particulier en périphérie. En conservant entre 96,5 % et 97,4 % des performances de référence BF16 sur des benchmarks exigeants de raisonnement, de suivi d’instructions et d’agenticité, LiquidAI démontre que la distillation quantization-aware peut réduire fortement les coûts de mémoire et de calcul sans sacrifier la qualité. L’accent mis sur des profils de vitesse et de taille sur MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra et Raspberry Pi 5 illustre la volonté de fournir des modèles réellement utilisables sur une large gamme de matériels. En combinant des checkpoints Q4_0 optimisés et une évaluation systématique sur des tâches variées comme GPQA Diamond, MMLU-Pro ou GSM8K, LiquidAI contribue à rapprocher l’exécution locale de modèles LFM2.5 des contraintes opérationnelles des développeurs et des cas d’usage d’IA en périphérie.
Questions fréquentes
Quels modèles LFM2.5 disposent de checkpoints QAD Q4_0 GGUF ?
Les checkpoints QAD Q4_0 GGUF couvrent LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct et LFM2.5-2.6B.
Quel gain de qualité offrent les checkpoints QAD Q4_0 par rapport au BF16 ?
Les checkpoints QAD Q4_0 conservent 97,1 %, 96,5 %, 97,4 % et 96,6 % des performances de leurs baselines BF16 selon LiquidAI.
Quels benchmarks sont utilisés pour évaluer les checkpoints QAD Q4_0 ?
LiquidAI utilise GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, ainsi que GSM8K et AIME25 pour l’évaluation mathématique.
Sur quels matériels les performances en périphérie sont mesurées ?
Les performances sont profilées sur MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra et Raspberry Pi 5.
Quel type d’inférence est utilisé sur chaque matériel de test ?
Le MacBook Pro et le NucBox EVO-X2 utilisent l’inférence GPU, tandis que le Samsung Galaxy S26 Ultra et le Raspberry Pi 5 utilisent l’inférence CPU Arm.
Source
Hugging FaceAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.