Video-Use
Skill de montage vidéo pilotée par un agent, publiée par l'équipe derrière browser-use. Le modèle ne regarde jamais la vidéo : il la lit à travers une transcription horodatée au mot près, avec identification des locuteurs et repérage des évènements sonores, ce qui lui permet de couper sur une frontière de mot et non sur une seconde approximative. Retrait des hésitations, étalonnage automatique, fondus audio, incrustation de sous-titres et génération d'animations en surimpression via HyperFrames, Remotion, Manim ou PIL. S'installe comme une skill Claude Code par clonage puis lien symbolique, et s'appuie sur ffmpeg, plus yt-dlp si la source est une adresse en ligne.
Forces
- Coupe à la frontière du mot grâce à une transcription horodatée, pas à la seconde approximative
- Le montage se décrit en langage naturel, sans apprendre l'interface d'un logiciel de montage
- Les rushes restent sur ta machine, seul le son part pour la transcription
Limites
- Une clé ElevenLabs est obligatoire et facturée par source : le dépôt est ouvert, l'usage ne l'est pas
- Installation par clonage et lien symbolique, avec ffmpeg à poser soi-même : rien de zéro-installation
- L'agent décide de la coupe sur du texte, donc il rate ce qui ne se dit pas : un regard, un geste, un plan qui traîne
Pour qui
- Sortir en série des formats courts qui suivent tous le même gabarit de montage
- Nettoyer une prise parlée sans ouvrir de logiciel de montage : hésitations, blancs, sous-titres
- Récupérer un rush trop long en le coupant depuis ce qui s'y dit, quand le repérage à l'œil prendrait la soirée