RIS-Kernel : une architecture indépendante du modèle pour l'inférence LLM sur long contexte via attention parcimonieuse
9/10RIS-Kernel propose un moteur d'inférence permettant aux grands modèles de langage de gérer des contextes supérieurs à 65 536 tokens en réduisant la complexité quadratique de l'attention complète grâce à un mécanisme d'attention parcimonieuse. Cette approche améliore significativement la scalabilité en production des modèles LLM traitant de longs documents, tout en maintenant la généralité multi-modèle.
