AutoResearch
Harness de recherche ML autonome par Andrej Karpathy. Un repo Python de ~630 lignes : `prepare.py` (intouchable, data + utils), `train.py` (modifié par l'agent, modèle, optimizer, loop), `program.md` (instructions agent). Un agent de code (Claude Code, Cursor, Codex) itère sur `train.py`, chaque run dure exactement 5 minutes, garde uniquement ce qui bat la val_bpb courante. ~100 expériences par nuit de sommeil.
Forces
- Minimal : 630 lignes Python total, tu lis le code en 30 minutes, tu comprends tout le pattern
- Boucle autonome validée : l'agent écrit + teste + commit sans intervention humaine, métrique objective (val_bpb)
- Compatible tous les agents de code (Claude Code, Cursor, Codex), tu pointes l'agent sur `program.md` et tu pars
- Signature Karpathy + 73k+ stars en quelques jours, base solide pour étudier ou forker vers un autre domaine
Limites
- Nécessite un GPU NVIDIA (testé sur H100), pas de mode CPU/MPS complet, barrière d'entrée matérielle forte
- Scope étroit : pré-training de petits modèles nanochat, pas un harness généraliste pour tout workflow autonome
- Coût LLM continu : chaque boucle expérimente via un agent payant, la facture monte vite si tu enchaînes 100 expériences
Pour qui
- Chercheurs ou ingénieurs ML qui veulent un banc minimal pour tester l'itération autonome par agent
- Étude du pattern "autonomous experiment loop" avant de le transposer à un autre domaine (prompt tuning, optimisation de requêtes SQL, etc.)
- Tech leads qui veulent démontrer concrètement aux équipes ce qu'un agent autonome peut faire en une nuit