Catalogue NVNC
COMMUNAUTÉ FRANCOPHONE · IA LOCALE

Qwen3.8A3BDistill_35.5B

Empero

DONNÉES ÉDITEUR

Qwen · 35,5B

Quantifications GGUF d'empire-ai/Qwen3.8-35B-A3B-Distill - une distillation des modèles de frontière Qwen3.8 dans l'architecture Qwen3.6-35B-A3B Mixture-of-Experts - pour llama.cpp, Ollama, LM Studio, Jan, KoboldCpp et d'autres runtimes GGUF de stock. Cette carte concerne le choix d'un fichier et son exécution. L'écriture des capacités, les résultats de référence et les meilleures pratiques sont en direct sur la carte modèle principale. 35B paramètres totaux avec ~3B actifs par jeton - la rparsité du MoE signifie qu'il fonctionne beaucoup plus vite qu'un 35B dense à la même quantité, mais l'ensemble du fichier de poids doit toujours tenir dans la RAM ou la VRAM.

NOTE COMMUNAUTAIREChargement…Lecture des avis
ArchitectureMoE · mélange d’experts
Contexte configuré262 144 tokens
LicenceApach2.0
Couches / têtes KV64 / 24
CALCUL NVNC · V0.1

Estimer la mémoire

Packages GGUF : vérifier le tag et la quantification réellement distribuée.

Mémoire totale non calculable : architecture MoE, à vérifier ou spécifications incomplètes. Poids seuls estimés : 22,2 Gio pour Q4_K_M. Le cache KV, le runtime et la marge totale restent à déterminer. Les benchmarks réels restent consultables.

Batch 1 · Cache KV FP16 · Marge 15 %. Le format exact de quantification et le runtime peuvent faire varier le résultat. Le runtime conserve ici une hypothèse commune de 0,75 Gio.

PISTES D’USAGE · SÉLECTION NVNC

À explorer pour…

Ces usages s’appuient sur les capacités annoncées. Ils ne constituent pas une évaluation comparative ni une garantie de résultat pour votre tâche.

Provenance

Consultez la source indiquée sur cette fiche pour vérifier les spécifications. Les conditions et noms originaux des benchmarks sont conservés séparément.

Compatibilité agentique · avec quel harness ?

Chargement des notes…

Moyenne des dernières notes par membre. Ces retours ne remplacent pas une validation technique.

À vérifier · Aucun test de ce couple modèle / harness enregistré dans NVNC.

Connexion possible via l’API compatible Anthropic d’Ollama. Appels d’outils et contexte suffisants à vérifier pour chaque modèle.

Documentation

Noter mon expérience avec ce harness

Modèle d’origine et dérivés · 0 référencés

Estimation : Q4_K_M · 4 096 tokens de contexte · 1 séquence. Notes propres à chaque modèle, dernière note de chaque membre.

Modèle / auteurTypeMoyenne /5Compatibilité théoriqueCompatibilité réelle déclarée
Qwen3.8A3BDistill_35.5B EmperoOriginalChargement…Estimation théorique indisponibleChargement…

Dérivés Hugging Face chargés automatiquement. Recherche dans les entrées déjà chargées. Les filiations non renseignées ou indirectes peuvent manquer. Les dépôts externes n’ont pas encore de notes ni de profil mémoire validé dans NVNC.

Matériel compatible · estimation et mesures réelles

Estimation mémoire : Q4_K_M · 4 096 tokens de contexte · 1 séquence. Aucun débit théorique calculé. Les benchmarks ci-dessous conservent leur configuration propre.

MatérielEstimation mémoireMesures réelles déclarées
Apple Silicon · 16 GoEstimation théorique indisponibleEstimation théorique indisponibleChargement…
Apple Silicon · 24 GoEstimation théorique indisponibleEstimation théorique indisponibleChargement…
CPU · 32 Go RAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
H100 PCIe · 80 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
H100 SXM · 80 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
H200 · 141 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
MacBook pro 16 poucesEstimation théorique indisponibleEstimation théorique indisponibleChargement…
NVIDIA DGX Spark · 128 Go unifiésEstimation théorique indisponibleEstimation théorique indisponibleChargement…
NVIDIA · 16 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
NVIDIA · 24 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 4060 Ti 16 Go · 16 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 4060 Ti 8 Go · 8 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 4060 · 8 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 4070 SUPER · 12 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 4070 Ti SUPER · 16 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 4070 Ti · 12 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 4070 · 12 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 4080 SUPER · 16 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 4080 · 16 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 4090 · 24 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 5050 · 8 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 5060 Ti 16 Go · 16 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 5060 Ti 8 Go · 8 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 5060 · 8 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 5070 Ti · 16 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 5070 · 12 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 5080 · 16 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…
RTX 5090 · 32 Go VRAMEstimation théorique indisponibleEstimation théorique indisponibleChargement…

Benchmarks communautaires

Chargement des mesures…

J’ai testé ce modèle

Un avis par membre et par modèle. Votre nouvel avis remplace le précédent dans les moyennes.

Chargement…

Notes de harness · facultatif

Notez uniquement les harness que vous avez testés. « Non évalué » retire votre ancienne note de ce harness.

LE MOTEUR DE COMPATIBILITÉ NVNC

Comment ça fonctionne ?

Votre besoin sélectionne des candidats. Votre matériel détermine la mémoire disponible. Le moteur et la quantification définissent le profil d’inférence.

Profil actuel : Ollama · Q4_K_M
4 096 tokens · 1 séquence(s) · 12 Gio disponibles selon le profil.

Une estimation explicite

Poids du modèle + cache KV FP16 + 0,75 Gio de runtime, puis 15 % de marge. Les poids utilisent une largeur moyenne approximative et une marge de 12 %.

Les variantes K_S, K_M et K_L peuvent mélanger plusieurs précisions. La taille exacte du package, les kernels et le backend doivent être vérifiés. Cette liste de profils ne garantit pas qu’un package existe pour chaque modèle.

La théorie et les mesures restent distinctes

La compatibilité mémoire ne prédit ni la vitesse ni la qualité. Les benchmarks déclarés précisent le contexte réel, sans être automatiquement certifiés.

Consulter la méthodologie complète

Comparer les modèles

Même quantification et même contexte. Aucune note de qualité supposée.

Critère
Paramètres
Contexte configuré
Mémoire estimée
Compatibilité
Licence
Usages