Aller directement au contenu
  • Catégories
  • Récent
  • Mots-clés
  • Populaire
  • Web
  • Utilisateurs
  • Groupes
Habillages
  • Clair
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • Sombre
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • Défaut (Aucun habillage)
  • Aucun habillage
Réduire

NodeBB

  1. Accueil
  2. General Discussion
  3. Linux
  4. IA
  5. LLama-swap : test du NVFP4

LLama-swap : test du NVFP4

Planifié Épinglé Verrouillé Déplacé IA
llama-swap
7 Messages 1 Publieurs 166 Vues
  • Du plus ancien au plus récent
  • Du plus récent au plus ancien
  • Les plus votés
Répondre
  • Répondre à l'aide d'un nouveau sujet
Se connecter pour répondre
Ce sujet a été supprimé. Seuls les utilisateurs avec les droits d'administration peuvent le voir.
  • Tuxedo17T
    Tuxedo17T
    Tuxedo17
    a écrit sur dernière édition par
    #1

    Chargement via :

    • https://huggingface.co/mudler/Qwen3.6-27B-NVFP4-GGUF/blob/main/q36-27b-nvfp4.gguf
    • https://huggingface.co/CodeFault/Unsloth-Qwen3.6-27B-NVFP4-GGUF/blob/main/Unsloth-Qwen3.6-27B-NVFP4-Q8.gguf

    Available Repositories & VariantsStandard NVFP4 GGUF:

    • Get the single-file setup from Mudler Qwen3.6-27B-NVFP4-GGUF optimized for Blackwell hardware and paged-attention.
    • MTP (Multi-Token Prediction) Variants: Find improved scale-fitting layout options at Michaelw9999 Qwen3.6-27B NVFP4 MTP GGUF.
    • Alternative Community Quantizations: Check out CodeFault Unsloth Qwen3.6-27B NVFP4 GGUF for standard implementation wrappers.

    Hardware Requirements & Running Tips :

    • GPU Support: Native FP4 Tensor Cores (such as NVIDIA Blackwell architectures like the RTX 5090) provide maximum processing speed.
    • Fallback execution: Non-Blackwell hardware falls back to standard dequantization, which reduces execution speeds.
    • Backend: Use updated builds of llama.cpp with -fa 1 (paged/flash attention) enabled for optimal throughput
    1 réponse Dernière réponse
    0
    • Tuxedo17T
      Tuxedo17T
      Tuxedo17
      a écrit sur dernière édition par
      #2

      Il y a une version MTP : https://huggingface.co/michaelw9999/Qwen3.6-27B-NVFP4-MTP-GGUF/blob/main/Qwen3.6-27B-NVFP4-MTP-GGUF.gguf .
      Cette version est trop grosse : https://huggingface.co/CodeFault/Nvidia-Qwen3.6-27B-NVFP4-GGUF/tree/main .

      1 réponse Dernière réponse
      0
      • Tuxedo17T
        Tuxedo17T
        Tuxedo17
        a écrit sur dernière édition par
        #3

        Il me faut mettre un truc du type :
        llama-cli -m Qwen3.6-27B-NVFP4-SMALL-MTP.gguf -ngl 48 -fa 1

        Actuellement j’ai -ngl 40 mais -ngl 48 en théorie cela passe. Envoie 48 couches sur la VRAM de la 5060 Ti .

        -fa 1 : Indispensable. Active la Flash/Paged Attention pour réduire drastiquement la taille du KV Cache en VRAM.

        Ma commande exacte actuellement :

        -m /models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf --ctx-size 180000 --temp 1 --top-p 0.95 --top-k 20 --min-p 0.00 --reasoning-preserve --host 0.0.0.0 --fit off -ngl 40 --port 8999
        
        1 réponse Dernière réponse
        0
        • Tuxedo17T
          Tuxedo17T
          Tuxedo17
          a écrit sur dernière édition par
          #4

          Le seul fichier GGUF pour le 35B c’est : https://huggingface.co/g0chu/Qwen3.6-35B-A3B-NVFP4-gguf
          Leur configuration :

          /home/gochu/workspace/repos/llama.cpp/build/bin/llama-server \
            -m /home/gochu/workspace/models/gguf/qwen/Qwen3.6-35B-A3B-NVFP4-nvidia \
            --host 0.0.0.0 \
            --port 8080 \
            -c 128000 \
            -ngl 99 \
            -b 2048 \
            -ub 1024 \
            -sm tensor \
            -fa on \
            -np 1 \
            --temp 0.6 \
            --top-p 0.95 \
            --top-k 20 \
            --min-p 0.00 \
            --spec-type draft-mtp \
            --spec-draft-n-max 3 \
            --chat-template-kwargs '{"preserve_thinking":true}' \
            --jinja \
            --no-mmproj-offload \
            --mmproj /home/gochu/workspace/models/gguf/qwen/mmproj/mmproj-Qwen-Qwen3.6-27B-Q6_K.gguf \
            --image-min-tokens 1024
          

          Il faut que je l’adapte :

          llama-server \
            -m /models/Qwen3.6-35B-A3B-NVFP4-nvidia.gguf \
            --host 0.0.0.0 \
            --port 8080 \
            -c 180000 \
            -ngl 48 \
            -b 2048 \
            -ub 1024 \
            -sm tensor \
            -fa on \
            -np 1 \
            --temp 0.6 \
            --top-p 0.95 \
            --top-k 20 \
            --min-p 0.00 \
            --spec-type draft-mtp \
            --spec-draft-n-max 3 \
            --chat-template-kwargs '{"preserve_thinking":true}' \
            --jinja 
          
          1 réponse Dernière réponse
          0
          • Tuxedo17T
            Tuxedo17T
            Tuxedo17
            a écrit sur dernière édition par Tuxedo17
            #5

            Gémini :

            Quel est le meilleur modèle parmis ce que j’ai :

            $ du -sh /models/*
            769M /models/gemma-3-1b-it-q4_k_m.gguf
            889M /models/mmproj-BF16(1).gguf
            889M /models/mmproj-BF16.gguf
            885M /models/mmproj-F16.gguf
            2,3G /models/mmproj-F32.gguf
            24G /models/q36-27b-nvfp4.gguf
            1,1G /models/qwen2.5-1.5b-instruct-q4_k_m.gguf
            13G /models/Qwen3.5-27B-Q3_K_M.gguf
            5,3G /models/Qwen3.5-9B-Q4_K_M.gguf
            16G /models/Qwen3.6-27B-NVFP4-MTP-GGUF.gguf
            13G /models/Qwen3.6-27B-Q3_K_M.gguf
            16G /models/Qwen3.6-27B-Q4_K_M.gguf
            21G /models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf
            22G /models/Unsloth-Qwen3.6-27B-NVFP4-Q8.gguf

            Recommandation pour votre RTX 5080 Ti

            Le meilleur modèle absolu parmi votre liste pour votre configuration est :
            👉 Qwen3.6-27B-NVFP4-MTP-GGUF.gguf (ou sa variante Q8)

            Pourquoi ce choix ?

            1. Optimisation RTX 5000 : Votre carte graphique gère nativement le format ultra-rapide NVFP4, ce qui permet d’utiliser les cœurs Tensor dédiés de NVIDIA de manière optimale.
            2. Technologie MTP (Multi-Token Prediction) : Ce format permet de générer plusieurs jetons à la fois par cycle, offrant une vitesse de génération de texte foudroyante sur un GPU haut de gamme.
            3. Alternative pour le raisonnement complexe : Si vous privilégiez la précision logique ou le code, utilisez le Qwen3.6-35B-A3B-UD-Q4_K_M.gguf. Son architecture de mélange d’experts (MoE) offre d’excellentes performances intellectuelles pour un coût mémoire maîtrisé (21 Go).

            📅 Dates de sortie des modèles de votre liste

            Voici l’historique de vos fichiers classés de la génération la plus ancienne à la plus récente :

            🔹 Génération Qwen 2.5 — Septembre 2024

            • qwen2.5-1.5b-instruct-q4_k_m.gguf

            🔹 Génération Gemma 3 — Mars 2025

            • gemma-3-1b-it-q4_k_m.gguf

            🔹 Génération Qwen 3.5 — Février 2026

            • Qwen3.5-9B-Q4_K_M.gguf
            • Qwen3.5-27B-Q3_K_M.gguf

            🔹 Génération Qwen 3.6 — Avril 2026

            • Qwen3.6-27B-Q3_K_M.gguf
            • Qwen3.6-27B-Q4_K_M.gguf
            • q36-27b-nvfp4.gguf / Qwen3.6-27B-NVFP4-MTP-GGUF.gguf / Unsloth-Qwen3.6-27B-NVFP4-Q8.gguf
            • Qwen3.6-35B-A3B-UD-Q4_K_M.gguf

            👁️ Note sur les fichiers multimédias (mmproj)

            • mmproj-BF16(1).gguf
            • mmproj-BF16.gguf
            • mmproj-F16.gguf
            • mmproj-F32.gguf

            Usage : Ces fichiers ne sont pas des modèles de langage autonomes. Ce sont des projecteurs visuels. Ils servent à activer les capacités de Vision (analyse d’images) lorsque vous les associez à un modèle compatible dans votre interface (comme LM Studio ou Ollama).

            1 réponse Dernière réponse
            0
            • Tuxedo17T
              Tuxedo17T
              Tuxedo17
              a écrit sur dernière édition par
              #6

              Gémini :

              🏆 Le meilleur modèle Unsloth pour une RTX 5080 Ti

              La NVIDIA RTX 5080 Ti (architecture Blackwell) intègre des cœurs Tensor de nouvelle génération capables de traiter nativement le format FP4 de NVIDIA. Pour exploiter au maximum cette carte, deux modèles d’Unsloth se distinguent selon vos priorités :


              1. Le choix “Vitesse pure & Performance” : Qwen3.6-27B (NVFP4-MTP)

              • Pourquoi : Ce modèle utilise la quantification native NVFP4 d’Unsloth combinée à la prédiction multi-tokens (MTP).
              • Avantages : C’est le plus rapide sur votre architecture Blackwell. Le MTP permet de générer plusieurs jetons par cycle d’horloge, offrant un débit foudroyant (souvent supérieur à 80 tokens/sec) tout en logeant confortablement dans vos 16 Go de VRAM.

              2. Le choix “Intelligence & Code complexe” : Qwen3.6-35B-A3B (Dynamic GGUF)

              • Pourquoi : Il s’agit d’un modèle à mélange d’experts (MoE). Bien qu’il possède 35 milliards de paramètres au total, il n’en active que 3 milliards par token.
              • Avantages : Grâce aux versions Dynamic GGUF d’Unsloth (notamment le quant UD-Q4_K_M), il offre un niveau de raisonnement, de logique et de programmation nettement supérieur. Sa structure MoE le rend très léger à exécuter, ce qui laisse de la place pour de longs contextes sans saturer votre VRAM.

              📊 Tableau comparatif pour votre GPU

              Modèle Unsloth Format recommandé Point fort Empreinte VRAM estimée
              Qwen3.6-27B-NVFP4 .gguf (MTP) ou .safetensors Vitesse d’exécution maximale, idéal pour le chat fluide et l’analyse rapide. ~14 à 15 Go (Optimise la VRAM)
              Qwen3.6-35B-A3B UD-Q4_K_M.gguf Raisonnement complexe (Reasoning), logique, programmation avancée. ~12 Go (Idéal pour les longs contextes)

              💡 Verdict

              • Si vous faites du développement, du code ou de l’analyse logique, choisissez le Qwen3.6-35B-A3B-UD-Q4_K_M.gguf.
              • Si vous cherchez la vitesse de réponse maximale pour une utilisation quotidienne, choisissez le Qwen3.6-27B-NVFP4-MTP-GGUF.gguf.
              1 réponse Dernière réponse
              0
              • Tuxedo17T
                Tuxedo17T
                Tuxedo17
                a écrit sur dernière édition par
                #7

                NVIDIA : https://huggingface.co/nvidia/Qwen3.6-35B-A3B-NVFP4

                Exemple :

                models:
                  # Premier modèle : Llama 3 8B
                  - name: "meta-llama/Meta-Llama-3-8B-Instruct"
                    command: >
                      vllm serve meta-llama/Meta-Llama-3-8B-Instruct 
                      --port 8001 
                      --gpu-memory-utilization 0.85
                    ready_url: "http://127.0.0"
                    upstream_url: "http://127.0.0"
                
                1 réponse Dernière réponse
                0
                • fariasF farias a déplacé ce sujet de Linux sur

                Bonjour ! Vous semblez intéressé par cette conversation, mais vous n’avez pas encore de compte.

                Marre de refaire défiler les mêmes messages ? Créez un compte pour retrouver votre position, recevoir des notifications des nouvelles réponses, sauvegarder vos favoris et voter pour les messages que vous appréciez.

                Grâce à votre participation, ce message peut devenir encore meilleur 💗

                S'inscrire Se connecter
                Répondre
                • Répondre à l'aide d'un nouveau sujet
                Se connecter pour répondre
                • Du plus ancien au plus récent
                • Du plus récent au plus ancien
                • Les plus votés


                • Se connecter

                • Vous n'avez pas de compte ? S'inscrire

                • Connectez-vous ou inscrivez-vous pour faire une recherche.
                Powered by NodeBB Contributors
                • Premier message
                  Dernier message
                0
                • Catégories
                • Récent
                • Mots-clés
                • Populaire
                • Web
                • Utilisateurs
                • Groupes