-
Chargement via :
- https://huggingface.co/mudler/Qwen3.6-27B-NVFP4-GGUF/blob/main/q36-27b-nvfp4.gguf
- https://huggingface.co/CodeFault/Unsloth-Qwen3.6-27B-NVFP4-GGUF/blob/main/Unsloth-Qwen3.6-27B-NVFP4-Q8.gguf
Available Repositories & VariantsStandard NVFP4 GGUF:
- Get the single-file setup from Mudler Qwen3.6-27B-NVFP4-GGUF optimized for Blackwell hardware and paged-attention.
- MTP (Multi-Token Prediction) Variants: Find improved scale-fitting layout options at Michaelw9999 Qwen3.6-27B NVFP4 MTP GGUF.
- Alternative Community Quantizations: Check out CodeFault Unsloth Qwen3.6-27B NVFP4 GGUF for standard implementation wrappers.
Hardware Requirements & Running Tips :
- GPU Support: Native FP4 Tensor Cores (such as NVIDIA Blackwell architectures like the RTX 5090) provide maximum processing speed.
- Fallback execution: Non-Blackwell hardware falls back to standard dequantization, which reduces execution speeds.
- Backend: Use updated builds of llama.cpp with -fa 1 (paged/flash attention) enabled for optimal throughput
-
Il y a une version MTP : https://huggingface.co/michaelw9999/Qwen3.6-27B-NVFP4-MTP-GGUF/blob/main/Qwen3.6-27B-NVFP4-MTP-GGUF.gguf .
Cette version est trop grosse : https://huggingface.co/CodeFault/Nvidia-Qwen3.6-27B-NVFP4-GGUF/tree/main . -
Il me faut mettre un truc du type :
llama-cli -m Qwen3.6-27B-NVFP4-SMALL-MTP.gguf -ngl 48 -fa 1Actuellement j’ai -ngl 40 mais -ngl 48 en théorie cela passe. Envoie 48 couches sur la VRAM de la 5060 Ti .
-fa 1 : Indispensable. Active la Flash/Paged Attention pour réduire drastiquement la taille du KV Cache en VRAM.
Ma commande exacte actuellement :
-m /models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf --ctx-size 180000 --temp 1 --top-p 0.95 --top-k 20 --min-p 0.00 --reasoning-preserve --host 0.0.0.0 --fit off -ngl 40 --port 8999 -
Le seul fichier GGUF pour le 35B c’est : https://huggingface.co/g0chu/Qwen3.6-35B-A3B-NVFP4-gguf
Leur configuration :/home/gochu/workspace/repos/llama.cpp/build/bin/llama-server \ -m /home/gochu/workspace/models/gguf/qwen/Qwen3.6-35B-A3B-NVFP4-nvidia \ --host 0.0.0.0 \ --port 8080 \ -c 128000 \ -ngl 99 \ -b 2048 \ -ub 1024 \ -sm tensor \ -fa on \ -np 1 \ --temp 0.6 \ --top-p 0.95 \ --top-k 20 \ --min-p 0.00 \ --spec-type draft-mtp \ --spec-draft-n-max 3 \ --chat-template-kwargs '{"preserve_thinking":true}' \ --jinja \ --no-mmproj-offload \ --mmproj /home/gochu/workspace/models/gguf/qwen/mmproj/mmproj-Qwen-Qwen3.6-27B-Q6_K.gguf \ --image-min-tokens 1024Il faut que je l’adapte :
llama-server \ -m /models/Qwen3.6-35B-A3B-NVFP4-nvidia.gguf \ --host 0.0.0.0 \ --port 8080 \ -c 180000 \ -ngl 48 \ -b 2048 \ -ub 1024 \ -sm tensor \ -fa on \ -np 1 \ --temp 0.6 \ --top-p 0.95 \ --top-k 20 \ --min-p 0.00 \ --spec-type draft-mtp \ --spec-draft-n-max 3 \ --chat-template-kwargs '{"preserve_thinking":true}' \ --jinja -
Gémini :
Quel est le meilleur modèle parmis ce que j’ai :
$ du -sh /models/*
769M /models/gemma-3-1b-it-q4_k_m.gguf
889M /models/mmproj-BF16(1).gguf
889M /models/mmproj-BF16.gguf
885M /models/mmproj-F16.gguf
2,3G /models/mmproj-F32.gguf
24G /models/q36-27b-nvfp4.gguf
1,1G /models/qwen2.5-1.5b-instruct-q4_k_m.gguf
13G /models/Qwen3.5-27B-Q3_K_M.gguf
5,3G /models/Qwen3.5-9B-Q4_K_M.gguf
16G /models/Qwen3.6-27B-NVFP4-MTP-GGUF.gguf
13G /models/Qwen3.6-27B-Q3_K_M.gguf
16G /models/Qwen3.6-27B-Q4_K_M.gguf
21G /models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf
22G /models/Unsloth-Qwen3.6-27B-NVFP4-Q8.ggufRecommandation pour votre RTX 5080 Ti
Le meilleur modèle absolu parmi votre liste pour votre configuration est :
👉Qwen3.6-27B-NVFP4-MTP-GGUF.gguf(ou sa variante Q8)Pourquoi ce choix ?
- Optimisation RTX 5000 : Votre carte graphique gère nativement le format ultra-rapide NVFP4, ce qui permet d’utiliser les cœurs Tensor dédiés de NVIDIA de manière optimale.
- Technologie MTP (Multi-Token Prediction) : Ce format permet de générer plusieurs jetons à la fois par cycle, offrant une vitesse de génération de texte foudroyante sur un GPU haut de gamme.
- Alternative pour le raisonnement complexe : Si vous privilégiez la précision logique ou le code, utilisez le
Qwen3.6-35B-A3B-UD-Q4_K_M.gguf. Son architecture de mélange d’experts (MoE) offre d’excellentes performances intellectuelles pour un coût mémoire maîtrisé (21 Go).
📅 Dates de sortie des modèles de votre liste
Voici l’historique de vos fichiers classés de la génération la plus ancienne à la plus récente :
🔹 Génération Qwen 2.5 — Septembre 2024
qwen2.5-1.5b-instruct-q4_k_m.gguf
🔹 Génération Gemma 3 — Mars 2025
gemma-3-1b-it-q4_k_m.gguf
🔹 Génération Qwen 3.5 — Février 2026
Qwen3.5-9B-Q4_K_M.ggufQwen3.5-27B-Q3_K_M.gguf
🔹 Génération Qwen 3.6 — Avril 2026
Qwen3.6-27B-Q3_K_M.ggufQwen3.6-27B-Q4_K_M.ggufq36-27b-nvfp4.gguf/Qwen3.6-27B-NVFP4-MTP-GGUF.gguf/Unsloth-Qwen3.6-27B-NVFP4-Q8.ggufQwen3.6-35B-A3B-UD-Q4_K_M.gguf
👁️ Note sur les fichiers multimédias (
mmproj)mmproj-BF16(1).ggufmmproj-BF16.ggufmmproj-F16.ggufmmproj-F32.gguf
Usage : Ces fichiers ne sont pas des modèles de langage autonomes. Ce sont des projecteurs visuels. Ils servent à activer les capacités de Vision (analyse d’images) lorsque vous les associez à un modèle compatible dans votre interface (comme LM Studio ou Ollama).
-
Gémini :
🏆 Le meilleur modèle Unsloth pour une RTX 5080 Ti
La NVIDIA RTX 5080 Ti (architecture Blackwell) intègre des cœurs Tensor de nouvelle génération capables de traiter nativement le format FP4 de NVIDIA. Pour exploiter au maximum cette carte, deux modèles d’Unsloth se distinguent selon vos priorités :
1. Le choix “Vitesse pure & Performance” : Qwen3.6-27B (NVFP4-MTP)
- Pourquoi : Ce modèle utilise la quantification native NVFP4 d’Unsloth combinée à la prédiction multi-tokens (MTP).
- Avantages : C’est le plus rapide sur votre architecture Blackwell. Le MTP permet de générer plusieurs jetons par cycle d’horloge, offrant un débit foudroyant (souvent supérieur à 80 tokens/sec) tout en logeant confortablement dans vos 16 Go de VRAM.
2. Le choix “Intelligence & Code complexe” : Qwen3.6-35B-A3B (Dynamic GGUF)
- Pourquoi : Il s’agit d’un modèle à mélange d’experts (MoE). Bien qu’il possède 35 milliards de paramètres au total, il n’en active que 3 milliards par token.
- Avantages : Grâce aux versions Dynamic GGUF d’Unsloth (notamment le quant
UD-Q4_K_M), il offre un niveau de raisonnement, de logique et de programmation nettement supérieur. Sa structure MoE le rend très léger à exécuter, ce qui laisse de la place pour de longs contextes sans saturer votre VRAM.
📊 Tableau comparatif pour votre GPU
Modèle Unsloth Format recommandé Point fort Empreinte VRAM estimée Qwen3.6-27B-NVFP4 .gguf(MTP) ou.safetensorsVitesse d’exécution maximale, idéal pour le chat fluide et l’analyse rapide. ~14 à 15 Go (Optimise la VRAM) Qwen3.6-35B-A3B UD-Q4_K_M.ggufRaisonnement complexe (Reasoning), logique, programmation avancée. ~12 Go (Idéal pour les longs contextes)
💡 Verdict
- Si vous faites du développement, du code ou de l’analyse logique, choisissez le
Qwen3.6-35B-A3B-UD-Q4_K_M.gguf. - Si vous cherchez la vitesse de réponse maximale pour une utilisation quotidienne, choisissez le
Qwen3.6-27B-NVFP4-MTP-GGUF.gguf.
-
NVIDIA : https://huggingface.co/nvidia/Qwen3.6-35B-A3B-NVFP4
Exemple :
models: # Premier modèle : Llama 3 8B - name: "meta-llama/Meta-Llama-3-8B-Instruct" command: > vllm serve meta-llama/Meta-Llama-3-8B-Instruct --port 8001 --gpu-memory-utilization 0.85 ready_url: "http://127.0.0" upstream_url: "http://127.0.0" -
F farias a déplacé ce sujet de Linux sur
Bonjour ! Vous semblez intéressé par cette conversation, mais vous n’avez pas encore de compte.
Marre de refaire défiler les mêmes messages ? Créez un compte pour retrouver votre position, recevoir des notifications des nouvelles réponses, sauvegarder vos favoris et voter pour les messages que vous appréciez.
Grâce à votre participation, ce message peut devenir encore meilleur 💗
S'inscrire Se connecter