Aller au contenu
🦀LA COMMUNAUTÉcommunaute-ia.fr

← Toutes les actus

r/LocalLLaMA·

Quantification : les utilisateurs FP8/BF16 face à une inférence en IQ1_S

Sur r/LocalLLaMA, l'utilisateur zyxciss s'interroge : pourquoi les personnes qui font tourner leurs modèles en FP8 ou BF16 réagissent-elles avec autant d'horreur face à quelqu'un qui infère en IQ1_S ? La question s'étend à toute quantification 4 bits, FP4 ou INT4. Le fil illustre le clivage entre fidélité des poids et compression extrême pour tenir sur du matériel modeste.

open-sourcematérieldev

Source : r/LocalLLaMA

Lire la source d'origine ↗

🦀 Brève rédigée automatiquement le 3 oct. 2026 · 12:48 — voir la méthode.