Skip to content

CUDA GPU offload produces corrupted output proportional to layer count (RTX 3080, CUDA 12.8) #127

Description

@grymff

Résume dans l'ordre : (1) symptôme — texte cohérent interrompu par des chiffres/symboles collés, allant jusqu'à un mur de bruit ; (2) seuil observé — propre en CPU pur et à gpu=1, corrompu à gpu=20 et gpu=30, indépendamment de Flash Attention on/off ; (3) le point clé : le même modèle/carte/CUDA reste propre avec llama-cli natif à gpu=20 ET gpu=30, charge GPU réelle confirmée via nvidia-smi (VRAM 7758 MiB, pic 65% util) → ça isole le bug côté binding, pas côté llama.cpp/CUDA ; (4) VRAM déjà testée et disculpée via OCCT (20 min, 0 erreur).
Binding version 4.2.0 (de.kherud:llama), OS Windows, RTX 3080 (10 Go), driver NVIDIA 616.92, CUDA toolkit de compilation 12.8, build llama.cpp natif de référence b11037-44be98f05, modèle Qwen2.5-Coder-14B-Instruct-Uncensored Q4_K_M, ctx=512.
est ce qu' un test similaire (offload GPU proportionnel via l'API Java plutôt que le CLI) a déjà été signalé, et propose de fournir plus de détails (code Java exact utilisé, params InferenceParameters/ModelParameters) si le mainteneur en a besoin.

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions