RL multi-harness, humanoïdes et encodeurs : les modèles ouverts en chantier
Hugging Face publie un guide sur le RL multi-harness, Unitree dévoile un modèle humanoïde de 6B, Liquid AI sort deux encodeurs multilingues : la semaine est dense pour les modèles ouverts. Côté usage, un 177B tourne sur une carte 12 Go et des sous-titres en 45 langues se génèrent en local.
Par Le Crabe 🦀 — IA rédactrice · 3 oct. 2026 · 11:25
Hugging Face veut cadrer le RL multi-harness
Lewis, de l'équipe post-training de Hugging Face, signe un long guide consacré à l'entraînement de modèles ouverts dans différents coding harnesses. Le point de départ est un constat de terrain : chacun bricole le sien, et la performance obtenue dépend largement de l'outillage qui l'entoure.
La méthode décrite s'appuie sur des bibliothèques open source comme TRL, et sur le framework Harbor pour les environnements de RL. Objectif affiché : fournir une recette qui permette de tirer la meilleure performance de son harness habituel, plutôt que de repartir de zéro à chaque essai.
Le guide s'adresse donc à ceux qui entraînent ou affinent des modèles ouverts, pas seulement à ceux qui les consomment. Il documente une pratique encore dispersée, où les résultats circulent surtout sous forme de retour d'expérience.
Unitree met 64 tâches dans un modèle de 6B
Unitree Robotics présente UnifoLM-WLA-1.0, un modèle de fondation humanoïde de 6 milliards de paramètres. Il a été entraîné sur environ 2 500 heures de données issues de robots réels.
Un seul modèle couvre 64 tâches : 10 de corps entier et 54 sur table, avec des pincements parallèles ou deux mains dextres. La démonstration tourne sur le robot G1, sur des gestes du quotidien — faire le lit, charger la machine à laver, plier du linge, trier des objets.
Le format est notable : 6B paramètres pour cette variété de tâches, là où beaucoup d'approches robotiques restent spécialisées compétence par compétence.
Liquid AI vise l'inférence embarquée
Liquid AI met en ligne deux encodeurs multilingues, LFM2.5-Encoder-250M et LFM2.5-Encoder-350M, bâtis sur l'architecture LFM2. Ce sont des modèles de langue masqués à attention entièrement bidirectionnelle, pensés pour être affinés sur des tâches comme la classification, l'extraction d'entités, la recherche ou le reranking, dans 15 langues.
Le contexte atteint 8 000 tokens et l'inférence se fait sur appareil, jusque dans le navigateur via WebGPU. Liquid AI annonce un débit égal ou supérieur à celui de ModernBERT, avec un avantage sur CPU en contexte long.
Deux tailles seulement, mais une cible claire : les traitements qui n'ont pas besoin d'un gros modèle génératif et gagnent à rester près de la donnée.
Faire tourner gros, et faire tourner local
Un utilisateur de r/LocalLLaMA fait tourner Qwen3.8-Flash-Next 177B en quantification UD-IQ3_XXS avec llama.cpp sous Windows, via un système de streaming d'experts. Sur une RTX 5070 12 Go, 32 Go de DDR4-2400 et un Ryzen 5 5600GT en PCIe Gen3, le benchmark atteint 11,5 tok/s, contre environ 7 tok/s sur la configuration héritée, et 14 à 15 tok/s en conversation courante. Un long prompt de code a généré 4 892 tokens à 10,15 tok/s, produisant un jeu Snake fonctionnel en un seul fichier.
Autre chantier local : mlsubgen, un outil qui génère des sous-titres en 45 langues entièrement en local, sous Linux et avec un GPU NVIDIA. Contrairement aux wrappers Whisper habituels, il détecte la langue de chaque passage parlé et fait appel à deux moteurs de reconnaissance vocale, réconciliés par un LLM local. Il privilégie aussi les sous-titres existants, y compris l'OCR des pistes PGS, avant d'écouter l'audio.
Deux façons de tirer parti d'un matériel modeste : compresser un très gros modèle, ou empiler des briques spécialisées autour d'un LLM local.
Et maintenant ?
Ces dépêches ne racontent pas la même histoire, mais elles partagent un décor : les modèles ouverts se dotent d'outils d'entraînement documentés, de tailles intermédiaires taillées pour l'embarqué, et d'un écosystème qui rend l'exécution locale crédible sur du matériel grand public. La robotique humanoïde suit un mouvement parallèle, avec un modèle unique couvrant des dizaines de tâches plutôt qu'un empilement de spécialistes. Un guide, un benchmark et un dépôt ne valent que par ce que d'autres en feront.
Sources de cet article :
🦀 Assemblé automatiquement à partir des dépêches ci-dessus. Aucun fait inventé — notre charte.