Modèles
Modèles commerciaux et open-weight — même template pour les deux afin de les rendre comparables et faciles à mettre à jour lors d'un changement de version. Chaque ligne indique la date de la dernière vérification ; les modèles évoluent rapidement, ne faites pas confiance à une ligne obsolète.
| Modèle | Type | Lancement | Contexte | Auto-hébergeable | Force | Verdict | Source |
|---|---|---|---|---|---|---|---|
| Claude (Anthropic) Anthropic |
commercial | 2026 · génération 5 | 200k | non | Quatre niveaux (Haiku 4.5 / Sonnet 5 / Opus 5 / Fable 5) — du moins cher et rapide au code agentique complexe. Un bon équilibre coût/qualité au niveau Sonnet. | Le choix par défaut raisonnable si vous n'avez pas d'objection à dépendre du cloud et que vous recherchez le meilleur équilibre qualité/coût par niveau. | source ↗ verified 2026-08-21 |
| ChatGPT / GPT-5.6 + Codex (OpenAI) OpenAI |
commercial | 2026 · famille GPT-5.6 | 128k | non | Codex n'est plus un produit séparé — c'est une stack unifiée GPT-5+Codex. Le modèle de code actuel est GPT-5.3-Codex, avec une variante Max pour le travail agentique long et une Mini moins chère. | Particulièrement fort pour les tâches de code de format long/agentique via Codex ; ChatGPT standard pour tout le reste. | source ↗ verified 2026-08-21 |
| Gemini (Google) Google DeepMind |
commercial | 2026 · famille 3.x | 1000k | non | 3.1 Pro et 3 Deep Think pour le raisonnement de pointe ; 3.5/3.6 Flash pour les agents et le code à moindre coût ; contexte jusqu'à 1 M de tokens dans les variantes haut de gamme. | L'option de fenêtre de contexte la plus large si vous devez insérer des documents massifs d'un seul coup. | source ↗ verified 2026-08-21 |
| Qwen3.6 (Alibaba) Alibaba (Équipe Qwen) |
open-weight | avril 2026 | 262k | yes | Famille avec la cadence de release la plus active du T1 2026. La variante 27B dense est le point idéal pour le self-hosting réel : contexte natif de 262K, multimodal, bonnes performances en code. | Le meilleur choix pratique pour exécuter localement aujourd'hui si vous avez 1-2 GPU grand public — c'est ce que ce site exécute en production. | source ↗ verified 2026-08-21 |
| Kimi K3 (Moonshot AI) Moonshot AI |
open-weight | juillet 2026 | 1048k | non | Le plus grand modèle open-source lancé à ce jour, avec une attention hybride (Kimi Delta Attention) et un mode de raisonnement toujours actif. Contexte d'environ 1 million de tokens. | Ouvert ne signifie pas toujours auto-hébergeable — voici l'exemple : la licence est libre, mais le matériel requis ne l'est pas. | source ↗ verified 2026-08-21 |
| DeepSeek V4 (DeepSeek) DeepSeek |
open-weight | avril 2026 (Preview) | 1000k | non | Réinitialisation architecturale vers l'attention hybride, l'histoire d'efficacité la plus forte du groupe open-weight en tokens de calcul malgré la taille. | Meilleur rapport capacité/computo pour le lot open-weight, mais l'auto-hébergement réel nécessite une infrastructure multi-GPU propre. | source ↗ verified 2026-08-21 |
Notes d'hébergement local
Claude (Anthropic)Uniquement API/cloud — sans poids ouverts.
ChatGPT / GPT-5.6 + Codex (OpenAI)Uniquement API/cloud.
Gemini (Google)Uniquement API/cloud (le frère ouvert est Gemma, pas Gemini).
Qwen3.6 (Alibaba)La variante dense 27B s'exécute sur 1-2 GPU grand public (Q4) — la même taille que Sol, le modèle principal de ce site.
Kimi K3 (Moonshot AI)Poids ouverts, mais 2,8T de paramètres est une échelle de centre de données — cela ne rentre pas dans du matériel grand public même s'il est 'open-weight'.
DeepSeek V4 (DeepSeek)V4-Flash (la variante petite) demande encore ~172 Go de VRAM en Q4 — hors de portée d'une seule GPU grand public, faisable sur un rack multi-GPU dédié.