AutoResearchClaw: pipeline de recherche autonome piloté par LLM avec intervention humaine
Recherche entièrement autonome et évolutive, de l'idée à l'article. Discutez d'une idée. Obtenez un papier.
En bref
- De quoi s’agit-il ?
- Système Python d'orchestration de recherche en 23 étapes transformant une question de recherche en article académique complet, avec exécution d'expériences, synthèse de littérature et vérification anti-hallucination.
- À qui s’adresse-t-il ?
- AutoResearchClaw s'adresse aux chercheurs cherchant une assistance à la rédaction et à la conceptiond'expériences qui respecte le processus académique. Les chercheurs en chimie, en physique des hautes énergies ou en biologie auront accès à des agents spécialisés par domaine.
- Puis-je l’utiliser commercialement ?
- Oui. MIT est une licence permissive : vous pouvez utiliser, modifier et vendre un logiciel qui en dépend, à condition de conserver les mentions de droit d’auteur et de licence.
- Est-il encore maintenu ?
- Oui. Les derniers commits datent d’il y a 28 jours.
- En quel langage est-il écrit ?
- Principalement Python, d’après les statistiques de langage de GitHub.
Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 15 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.
ANALYSE OPEN SOURCE APPROFONDIE
Architecture en phases et routes d'intégration
AutoResearchClaw orchestre la génération de recherche via huit phases couvrant 23 étapes. La phase A (TOPIC_INIT, SCOPE_DEFINE) établit le périmètre, la phase B (LIT_SEARCH) collecte la littérature depuis OpenAlex, Semantic Scholar et arXiv, la phase C (SYNTH_LIT, HYPO_GEN) synthétise les connaissances et génère des hypothèses, la phase D (EXP_DESIGN, CODE_GEN) conçoit les expériences et génère le code, la phase E (SANDBOX_EXEC, RESULT_PROCESS) exécute en environnement contrôlé, la phase F (ANALYSIS, DECIDE_PROCEED) analyse les résultats avec décision PROCEED/REFINE/PIVOT, la phase G (PAPER_DRAFT, MULTI_REVIEW) rédige et relit, la phase H (EXPORT_LATEX, KNOW_ARCHIVE) finalise avec LaTeX et archivage des connaissances. Trois points de pause explicite (étapes 5, 9 et 20) attendent l'approbation humaine par défaut, contournables avec --auto-approve. Le dépôt compte 14 266 étoiles et 1 659 forks (dernière mise à jour 20 mai 2026).
Multiples points d'intégration: CLI autonome, API Python, OpenClaw et messagers
Le pipeline peut s'exécuter via plusieurs chemins. Le chemin OpenClaw accepte l'URL du dépôt, lit RESEARCHCLAW_AGENTS.md et attend des demandes du type « Research [topic] » via Discord, Telegram, Lark ou WeChat. La ligne de commande autonome utilise researchclaw run --topic "..." --auto-approve. L'API Python importe from researchclaw.pipeline import Runner. Le système supporte tout backend d'agent ACP-compatible (Claude Code, Codex CLI, Copilot CLI, Gemini CLI, Kimi CLI), avec délégation configurable des étapes 10 et 13 (code generation) à des agents CLI externes et contrôle de budget/timeout. Le README énumère ces options précisément mais n'en détaille pas l'ordre de priorité.
Modes collaboratifs HITL et politiques d'intervention par étape
Le système HITL (Human-in-the-Loop) de v0.4.0 propose six modes: full-auto (pas d'intervention), gate-only (points de pause prédéfinis), checkpoint (pause à intervalles réguliers), step-by-step (chaque étape nécessite approbation), co-pilot (intervention intelligente basée sur la confiance), custom (politiques par étape). Les fonctionnalités collaboratives incluent Idea Workshop pour la co-création d'hypothèses (utilisateur et IA affinent ensemble les directions), Baseline Navigator pour examiner les designs expérimentaux et demander l'ajout de techniques (Dropout, Label Smoothing, MixUp, CutMix citées à titre d'exemple), Paper Co-Writer pour la rédaction collaborative, SmartPause pour pause dynamique quand la confiance du modèle chute, garde-fous de budget en dollars, et branchement du pipeline pour explorer des hypothèses en parallèle.
Agents spécialisés par domaine et exécuteurs multi-bac
La v0.5.0 introduit le routage des étapes 10-13 (exécution d'expériences) vers des agents spécialisés selon le domaine détecté. ColliderAgent traite la physique des hautes énergies via Lagrangian -> FeynRules -> MadGraph5 (via cloud Magnus) -> Delphes. L'agent biologie utilise COBRApy pour la modélisation métabolique à l'échelle du génome. L'agent statistique lance des études de simulation. Un exécuteur Docker générique couvre la chimie et les matériaux. Le pipeline auto-sélectionne l'exécuteur apropié. Le benchmark ARC-Bench (55 sujets, 55 manifestes) couvre ML (25 sujets), physique HEP (10), quantique (10), biologie (7) et statistiques (3). Chaque sujet inclut la question de recherche, les conditions, les métriques et les datasets; un rubric fournit les critères de notation.
Vérification anti-hallucination et VerifiedRegistry
AutoResearchClaw impose une chaîne de vérification des citations en quatre étages: validation arXiv (ID correct), CrossRef (DOI valide), DataCite (métadonnées de donnée), et un score de pertinence LLM. La VerifiedRegistry stocke les données expérimentales vérifiées et force leur inclusion dans l'article. Un système de diagnostic et réparation automatiques détecte les expériences échouées et tente une correction avant de relancer. Le rapport de vérification (verification_report.json) énumère tous les artefacts vérifiés et les affirmations non couvertes. Aucune affirmation sans citation ne peut apparaître dans le brouillon final. Ces mécanismes visent à réduire l'auto-confabulation propre aux pipelines LLM purs.
Apprentissage autonome via MetaClaw et bibliothèque de compétences
MetaClaw (intégration optionnelle, désactivée par défaut via metaclaw_bridge.enabled: true) capture les leçons des échecs et des avertissements de chaque exécution, les convertit en compétences réutilisables (fichiers Markdown) et les injecte automatiquement dans les 23 étapes lors des exécutions futures. Le README rapporte une expérience contrôlée où le score de robustesse composite passe de 0,714 à 0,845 avec MetaClaw, mais sans décrire la méthodologie du benchmark. La bibliothèque de compétences pré-intégrée contient 20 compétences (rédaction scientifique, recherche documentaire, chimie, biologie). Les utilisateurs peuvent charger des compétences open source via researchclaw skills install <url> ou ajouter des fichiers SKILL.md dans .claude/skills/. Une compétence communautaire A-Evolve (évolution agentique) provient du dépôt A-EVO-Lab.
Fichiers de sortie et configuration de conférence cible
Chaque exécution génère: paper_draft.md (brouillon Markdown), paper.tex (source LaTeX compilable), references.bib (BibTeX), verification_report.json (audit de citations), code des expériences, graphiques PNG, notes de relecture multi-agents, répertoire evolution/ (leçons auto-apprentissage), dossier deliverables/ (sorties finales). La configuration config.arc.yaml contrôle le projet, la recherche, le mode d'exécution (simulated, sandbox Docker, SSH remote), le fournisseur LLM, la conférence cible (NeurIPS, ICML, ICLR) pour la mise en forme LaTeX, les paramètres HITL, la sécurité et le backend de connaissance. Un mode HEP-ph spécialisé route les étapes d'expérience via ColliderAgent plutôt que le sandbox ML par défaut. Les sorties sont écrites dans artifacts/rc-YYYYMMDD-HHMMSS-hash/deliverables/.
Historique des versions et stabilité cross-platform
La v0.5.0 (mai 2026) introduit les agents multi-domaine et ARC-Bench. La v0.4.0 (avril 2026) ajoute le système HITL complet. La v0.3.2 (mars 2026) apporte le support cross-platform (Claude Code, Codex, Copilot, Gemini, Kimi CLI) et la stabilité majeure via anti-fabrication, executor modulaire, --resume auto-détection, et hardening des retry LLM. La v0.3.1 introduit Beast Mode pour la génération de code complexe via OpenCode. La v0.3.0 intègre MetaClaw. La v0.2.0 ajoute trois sous-systèmes multi-agents (CodeAgent, BenchmarkAgent, FigureAgent) et audit de qualité de 4 tours. La v0.1.0 (mars 2026) lance la pipeline en 23 étapes avec sandbox Docker. Le README invite les testeurs à explorer avec leurs propres idées de recherche.
Conclusion éditoriale
AutoResearchClaw s'adresse aux chercheurs cherchant une assistance à la rédaction et à la conceptiond'expériences qui respecte le processus académique. Les chercheurs en chimie, en physique des hautes énergies ou en biologie auront accès à des agents spécialisés par domaine. Les équipes sans accès aux ressources GPU ou sans modèles LLM fiables devraient tester sur des projets de petite taille d'abord. Avant utilisation, configurer le mode HITL (Human-in-the-Loop) et les garde-fous de budget de coût pour éviter les dépassements.
Notes de la communauté