AnchorKV : Compression du cache clé-valeur résiduel pour optimiser l'inférence de LLM à long contexte
9/10AnchorKV introduit une méthode de compression du cache clé-valeur par résidus pour les LLM à contexte étendu, réduisant la mémoire utilisée tout en maintenant la performance. Les expérimentations montrent des gains significatifs en vitesse d'inférence et en économie de mémoire, facilitant le déploiement de modèles LLM long contexte à grande échelle.
