Modèle / jeu de données
kayba-ai/agentic-context-engine avatar
kayba-ai/agentic-context-engine

Agentic Context Engine : une boucle d'apprentissage persistante pour agents LLM

🧠 Make your agents learn from experience. Now available as a hosted solution at kayba.ai

2 573 étoiles309 forksPythonApache-2.0

En bref

De quoi s’agit-il ?
ACE transforme les traces d'exécution en stratégies réutilisables, stockées dans un Skillbook. Le projet est utile si vos agents répètent les mêmes erreurs, mais il ajoute une couche d'orchestration et de coût à chaque appel.
À qui s’adresse-t-il ?
ACE convient aux équipes qui font tourner des agents sur des tâches répétitives et qui acceptent de payer un appel LLM supplémentaire pour transformer chaque échec en stratégie réutilisable. Il ne convient pas à celles qui cherchent un simple cache de contexte ou qui refusent toute dépendance à un fournisseur de modèles.
Puis-je l’utiliser commercialement ?
Oui. Apache-2.0 est une licence permissive : vous pouvez utiliser, modifier et vendre un logiciel qui en dépend, à condition de conserver les mentions de droit d’auteur et de licence.
Est-il encore maintenu ?
Oui. Les derniers commits datent d’il y a 4 jours.
En quel langage est-il écrit ?
Principalement Python, d’après les statistiques de langage de GitHub.

Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 15 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.

ANALYSE OPEN SOURCE APPROFONDIE

Un agent qui oublie ce qu'il vient d'apprendre

Le problème visé est précis : un agent LLM sans mémoire procédurale répète la même erreur à chaque session. Le README le formule sans détour, les agents ne tirent pas d'enseignement de l'expérience. Le projet s'adresse donc aux développeurs qui exécutent des agents sur des tâches récurrentes (navigation, extraction, résolution de tickets) et qui constatent que les corrections apportées manuellement ne survivent pas au redémarrage suivant. ACE ne cherche pas à améliorer le raisonnement du modèle. Il construit une mémoire externe de stratégies, que le modèle consulte avant d'agir. C'est une distinction importante : le modèle reste identique, c'est le contexte injecté qui change.

Le Skillbook et ses trois rôles

L'architecture repose sur un objet central, le Skillbook, décrit comme une collection persistante de stratégies qui évolue à chaque tâche. Trois rôles le font vivre. L'Agent exécute la tâche en étant augmenté des stratégies disponibles. Le Reflector analyse les traces d'exécution pour distinguer ce qui a fonctionné de ce qui a échoué. Le SkillManager, lui, curate le Skillbook : il ajoute, affine et supprime des stratégies. Le point technique le plus intéressant est le Recursive Reflector. Au lieu de résumer une trace en une seule passe, il écrit et exécute du code Python dans un environnement sandboxé pour rechercher programmatiquement dans la trace. Le README s'arrête au milieu de cette phrase, donc la mécanique exacte de cette recherche n'est pas documentée dans le matériel fourni. Ce que l'on peut dire : l'extraction de stratégies n'est pas un simple prompt de résumé, elle passe par du code exécuté.

Installation et configuration

L'installation se fait avec uv add ace-framework. Deux chemins de configuration sont proposés. Le premier, interactif, lance ace setup, qui guide la sélection du modèle, la saisie des clés d'API et la validation de la connexion. Le second est manuel : il faut exporter OPENAI_API_KEY, ou ANTHROPIC_API_KEY, ou la clé de l'un des fournisseurs pris en charge. Le README mentionne plus de 100 fournisseurs compatibles sans en donner la liste. Côté usage, l'API tient en quelques appels : on instancie ACELiteLLM avec un nom de modèle, on interroge l'agent via ask, on injecte une correction via learn_from_feedback, puis on inspecte ce qui a été retenu avec get_strategies. Le README précise qu'il n'y a ni fine-tuning, ni jeu de données d'entraînement, ni base vectorielle. Cette dernière absence est un choix de conception : les stratégies sont stockées comme du texte structuré, pas comme des embeddings, ce qui rend leur contenu lisible et modifiable à la main.

Ce que le projet annonce et ce qu'il ne prouve pas ici

Le README affiche trois résultats : un doublement de la métrique pass^4 sur le benchmark Tau2 airline avec 15 stratégies apprises et sans signaux de récompense, une réduction de 49 pour cent des tokens sur une tâche d'automatisation navigateur, et un coût d'apprentissage de 1,50 dollar pour une traduction de 14 000 lignes en TypeScript. Ces chiffres viennent du projet lui-même. Ils ne sont accompagnés ni de protocole détaillé, ni de conditions de reproduction dans le matériel fourni. Le cas Tau2 est le plus informatif, parce qu'il indique explicitement l'absence de signaux de récompense : l'apprentissage se fait donc à partir du texte des traces, pas d'un score externe. C'est ce qui rend la méthode applicable là où l'on ne dispose pas de métrique automatique. Pour le reste, considérez ces valeurs comme des ordres de grandeur revendiqués, pas comme des garanties.

Le coût caché de la boucle

Chaque cycle d'apprentissage consomme des appels LLM supplémentaires : le Reflector doit analyser la trace, le SkillManager doit décider quoi modifier. Sur une tâche courte et peu répétée, ce surcoût dépasse largement le bénéfice. ACE est donc un mauvais outil pour un agent à usage unique, pour une tâche dont le format change à chaque exécution, ou pour un pipeline où la latence est contrainte. Autre limite structurelle : le Skillbook est une mémoire cumulative. Rien dans le matériel fourni ne décrit de politique d'expiration ou de plafonnement de taille, même si le SkillManager est censé supprimer des stratégies. Sur un agent qui tourne des mois, la question de la dérive du Skillbook reste ouverte. Enfin, la qualité de l'apprentissage dépend entièrement de la qualité des corrections fournies à learn_from_feedback. Une correction erronée devient une stratégie persistante, et donc une erreur systématique.

Face à une mémoire vectorielle classique

L'alternative la plus directe est une base vectorielle couplée à un mécanisme de récupération : on stocke les échanges passés, on retrouve les plus proches du contexte courant, on les réinjecte. La différence d'approche est nette. Une base vectorielle restitue des exemples bruts ; ACE produit des stratégies reformulées et curatées, et surtout il supprime. Le SkillManager peut retirer une stratégie devenue fausse, ce qu'un index d'embeddings ne fait pas nativement. En contrepartie, ACE introduit deux étapes de traitement LLM entre la trace et la mémoire, donc de la latence et un risque d'erreur de reformulation. Une base vectorielle est aussi plus simple à auditer : on voit exactement quel échange a été remonté. Si votre besoin est de retrouver un contexte factuel, ACE est surdimensionné. Si votre besoin est d'éviter qu'un agent reproduise une erreur de méthode, l'approche par stratégies est plus adaptée.

Maintenance, versionnement et licence

Le dépôt est actif, avec un dernier push en août 2026 et une version v0.12.0 publiée en mai 2026 dont le libellé mentionne une réécriture RR/Skillbook v2 et un durcissement du SkillManager. Une réécriture de cette ampleur sur un composant central signifie que les API autour du Skillbook ont probablement bougé : vérifiez la compatibilité de votre code avant de monter de version. Le projet publie aussi des paquets séparés, @kayba_ai/tracing en 0.10.0 et @kayba_ai/openclaw-tracing en 0.1.1, ce qui suggère un écosystème en cours de découpage plutôt qu'une interface figée. La licence du dépôt est Apache-2.0, ce qui autorise l'usage commercial et la modification. Attention toutefois : le README présente ACE comme le moteur open source derrière Kayba, le service hébergé. La licence Apache-2.0 couvre le code du dépôt, pas le service. Si vous passez par kayba.ai pour l'investigation d'échecs et la livraison de correctifs en pull requests, vous entrez dans un cadre contractuel distinct, à examiner séparément.

Conclusion éditoriale

ACE convient aux équipes qui font tourner des agents sur des tâches répétitives et qui acceptent de payer un appel LLM supplémentaire pour transformer chaque échec en stratégie réutilisable. Il ne convient pas à celles qui cherchent un simple cache de contexte ou qui refusent toute dépendance à un fournisseur de modèles. Avant d'adopter, vérifiez deux points concrets : le comportement de learn_from_feedback sur vos propres traces, et la licence Apache-2.0 du dépôt par rapport aux conditions du service hébergé kayba.ai, qui n'est pas couvert par cette licence.

Sources officielles

  1. kayba-ai/agentic-context-engine on GitHub
  2. License: Apache-2.0
  3. Project website
  4. README
  5. Releases
Notes de la communauté

Notes de la communauté