Unlimited-OCR
Modèle d'extraction documentaire publié par Baidu le 23 juin 2026, sous licence MIT, 3 milliards de paramètres. Sa promesse tient dans son mot d'ordre affiché, « one-shot long-horizon parsing » : au lieu d'enchaîner une passe d'OCR par page, il expose une inférence multi-pages qui avale un PDF entier en une fois. Fenêtre de 32768 tokens, poids en safetensors BF16, servi par Transformers, vLLM, SGLang ou Docker Model Runner.
Forces
- Licence MIT sur un modèle de cette taille, ce qui reste rare dans la catégorie extraction documentaire
- Inférence multi-pages native : le PDF est traité en une passe, pas recollé après coup
- Exécution locale, donc les documents sensibles ne partent jamais chez un tiers
Limites
- Auto-hébergé veut dire matériel et chaîne de service à ta charge : la licence est gratuite, pas l'exploitation
- Modèle récent, publié à l'été 2026 : peu de retours de production, à vérifier sur ton propre corpus avant de t'y adosser
Pour qui
- Alimenter un RAG avec des PDF longs sans casser l'ordre de lecture ni les tableaux
- Traiter des documents confidentiels que tu ne peux pas envoyer à une API externe