Le panorama open-weight d'août 2026
Open-weight est une étiquette relative à la licence, pas au matériel requis. Les trois modèles les plus commentés de ce semestre le confirment.
Qwen3.6 — celui que vous pouvez vraiment exécuter vous-même.
Alibaba a maintenu le rythme de release le plus actif du semestre : Qwen3.5 en février, Qwen3.6 en avril. La variante dense de 27B est le point d'équilibre réel — elle s'exécute sur une ou deux GPU grand public en quantification Q4, avec un contexte natif de 262K et des capacités multimodales. C'est, aujourd'hui, l'option la plus pratique pour un self-hosting authentique sans acheter un rack.
Kimi K3 — ouvert, mais à l'échelle d'un datacenter
Moonshot AI a libéré Kimi K3 en juillet : 2,8 billions de paramètres dans une architecture MoE, avec 104B actifs par token et une fenêtre de contexte d'environ 1M de tokens. Selon ses propres métriques, il s'agit du plus grand modèle open-source libéré à ce jour. Mais « libéré » ne signifie pas « exécutable sur votre bureau » : activer 104B de paramètres par token reste une charge exigeant une infrastructure de centre de données, pas une GPU grand public.
DeepSeek V4 — l'histoire d'efficacité la plus forte du lot
DeepSeek a réinitialisé son architecture vers une attention hybride en avril : la variante V4-Pro atteint 1,6 billion de paramètres totaux avec 49B actifs, tandis que la variante V4-Flash se limite à 284B totaux / 13B actifs. Même la variante « petite » (Flash) nécessite de l'ordre de 170 Go de VRAM en quantification Q4 — hors de portée d'une GPU unique, mais réalisable sur un serveur multi-GPU dédié.
Le résumé honnête
Si vous disposez d'une ou deux GPU et souhaitez exécuter une tâche aujourd'hui : Qwen3.6 27B. Si vous recherchez la capacité maximale en poids ouvert et que vous n'hésitez pas à payer un fournisseur pour l'hébergement : Kimi K3 ou DeepSeek V4 via API. Le terme « ouvert » indique ce que vous pouvez faire avec la licence — pas ce que vous pouvez exécuter sur votre machine.