ik_llama.cpp plus rapide que le mainline ? Le test d'un utilisateur dit l'inverse
Sur r/LocalLLaMA, un utilisateur s'interroge : ik_llama.cpp, le fork d'ikawrakow, est présenté partout comme le roi de l'offloading hybride CPU/GPU et des performances MoE. Pourtant, sur sa machine multi-GPU asymétrique, le mainline de ggml-org le bat à chaque benchmark, et de loin. Il se demande s'il lui manque des flags, ou si ce fork n'est simplement pas conçu pour le layer splitting sur plusieurs GPU.
open-sourcematérieldev
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 7 oct. 2026 · 03:23 — voir la méthode.