Quantification : les utilisateurs FP8/BF16 face à une inférence en IQ1_S
Sur r/LocalLLaMA, l'utilisateur zyxciss s'interroge : pourquoi les personnes qui font tourner leurs modèles en FP8 ou BF16 réagissent-elles avec autant d'horreur face à quelqu'un qui infère en IQ1_S ? La question s'étend à toute quantification 4 bits, FP4 ou INT4. Le fil illustre le clivage entre fidélité des poids et compression extrême pour tenir sur du matériel modeste.
open-sourcematérieldev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 3 oct. 2026 · 12:48 — voir la méthode.