Pi-AutoResearch
Plugin pour Pi (coding agent CLI de Matthias 'badlogic' Müller) qui étend le pattern AutoResearch de Karpathy au-delà du training ML : tu donnes une cible benchmarkable (vitesse de tests, taille de bundle, score Lighthouse, allocations mémoire), l'agent itère toute la nuit, propose une optim, mesure, garde le commit si ça améliore, revert sinon. Preuve canonique : Tobi Lütke (CEO Shopify) l'a utilisé sur Liquid pour gagner 53% de perf en 93 commits autonomes (120 expériences), repéré par code_simple sur Instagram.
Forces
- Généralise le pattern AutoResearch à toute cible benchmarkable, pas limité au ML training
- Preuve Tobi Lütke / Shopify Liquid : 93 commits autonomes, 53% perf gain, 61% moins d'allocations, la référence canonique 2026
- Plugin pour Pi (badlogic), agent terminal léger, pas besoin de setup harness lourd
Limites
- Demande une cible mesurable et stable (script bench reproductible), sans ça, l'agent valide du bruit
- Coût LLM continu : chaque expérience appelle l'agent, 100 expériences peuvent coûter cher
- Couplé à Pi (badlogic), pas un harness standalone, suppose que tu utilises Pi en CLI
Pour qui
- Optimisation de perf sur du code prod avec un benchmark stable (Liquid, parsers, hot path SQL)
- Réduction de bundle size ou Lighthouse score avec un budget mesurable
- Tech leads qui veulent démontrer la valeur d'un agent autonome sur du code applicatif (pas seulement du ML)