Mise en cache des invites et optimisation du contexte
Les modèles intègrent des améliorations de mise en cache des invites par défaut afin d'accélérer les réponses et d'optimiser la réutilisation du contexte lors des sessions d'agents à plusieurs tours.
Les développeurs peuvent analyser les performances via le tableau de bord de mise en cache des invites et des outils de diagnostic afin d'identifier les opportunités de mise en cache manquées.
- Des points d'arrêt explicites permettent aux développeurs de définir précisément où se terminent les préfixes d'invites mis en cache.
- L'effort de raisonnement et la disponibilité des outils peuvent être modifiés en cours de session sans invalider le contexte précédemment mis en cache.
- GitHub indique que les améliorations de la mise en cache des invites ont réduit de plus de 50 % le traitement de nouveaux jetons d'invite sur des milliards de requêtes.