Résume dans l'ordre : (1) symptôme — texte cohérent interrompu par des chiffres/symboles collés, allant jusqu'à un mur de bruit ; (2) seuil observé — propre en CPU pur et à gpu=1, corrompu à gpu=20 et gpu=30, indépendamment de Flash Attention on/off ; (3) le point clé : le même modèle/carte/CUDA reste propre avec llama-cli natif à gpu=20 ET gpu=30, charge GPU réelle confirmée via nvidia-smi (VRAM 7758 MiB, pic 65% util) → ça isole le bug côté binding, pas côté llama.cpp/CUDA ; (4) VRAM déjà testée et disculpée via OCCT (20 min, 0 erreur).
Binding version 4.2.0 (de.kherud:llama), OS Windows, RTX 3080 (10 Go), driver NVIDIA 616.92, CUDA toolkit de compilation 12.8, build llama.cpp natif de référence b11037-44be98f05, modèle Qwen2.5-Coder-14B-Instruct-Uncensored Q4_K_M, ctx=512.
est ce qu' un test similaire (offload GPU proportionnel via l'API Java plutôt que le CLI) a déjà été signalé, et propose de fournir plus de détails (code Java exact utilisé, params InferenceParameters/ModelParameters) si le mainteneur en a besoin.
Résume dans l'ordre : (1) symptôme — texte cohérent interrompu par des chiffres/symboles collés, allant jusqu'à un mur de bruit ; (2) seuil observé — propre en CPU pur et à gpu=1, corrompu à gpu=20 et gpu=30, indépendamment de Flash Attention on/off ; (3) le point clé : le même modèle/carte/CUDA reste propre avec llama-cli natif à gpu=20 ET gpu=30, charge GPU réelle confirmée via nvidia-smi (VRAM 7758 MiB, pic 65% util) → ça isole le bug côté binding, pas côté llama.cpp/CUDA ; (4) VRAM déjà testée et disculpée via OCCT (20 min, 0 erreur).
Binding version 4.2.0 (de.kherud:llama), OS Windows, RTX 3080 (10 Go), driver NVIDIA 616.92, CUDA toolkit de compilation 12.8, build llama.cpp natif de référence b11037-44be98f05, modèle Qwen2.5-Coder-14B-Instruct-Uncensored Q4_K_M, ctx=512.
est ce qu' un test similaire (offload GPU proportionnel via l'API Java plutôt que le CLI) a déjà été signalé, et propose de fournir plus de détails (code Java exact utilisé, params InferenceParameters/ModelParameters) si le mainteneur en a besoin.