Paulo Vila AI Tier 0 : 96.2% | Économisé : 148,50 USD
introduction → development → conclusion

Which model to use for which task?

Tous les mois, un nouveau modèle sort qui se dit être « le meilleur ». La question qui compte réellement n'est pas celle-là — c'est où les données doivent résider et la durée de la tâche.

Le panorama commercial actuel

Claude est désormais à sa cinquième génération : Haiku 4.5 pour la rapidité et le coût réduit, Sonnet 5 comme équilibre qualité/coût, Opus 5 pour le code agentique complexe, et Fable 5 au sommet. OpenAI a unifié son stack de code sous GPT-5.6 — Codex n'est plus un produit séparé, mais le même stack avec un mode spécialisé (GPT-5.3-Codex, avec des variantes Max pour les tâches longues et Mini pour le coût). Gemini mise sur le contexte : ses variantes 3.1 Pro et 3 Deep Think atteignent des fenêtres de contexte jusqu'à 1 million de tokens, utile lorsque vous devez ingérer un document entier d'un coup.

Et les locaux

C'est ici que ce site prend position : si la tâche ne nécessite pas de raisonnement de pointe absolu, un modèle local résout la majorité des tâches quotidiennes à coût marginal nul. Qwen3.6 27B s'exécute sur une ou deux GPU grand public et dispose d'un contexte natif de 262K — c'est ce qui fonctionne sur ce même site.

La matrice réelle

  • Donnée sensible (clients, contrats, santé) : local, sans discussion.
  • Refonte majeure ou code agentique de format long : Claude Opus ou GPT-5.3-Codex-Max.
  • Importation de documents volumineux en une seule fois : Gemini, par la fenêtre de contexte.
  • Tout le reste — chat, résumés, tâches quotidiennes : le modèle local le moins cher qui résout bien.

La trappe la plus courante consiste à utiliser le modèle le plus cher « au cas où » pour des tâches triviales. La plupart de ce que vous faites quotidiennement est aussi bien résolu par un modèle de 8 à 27 B exécuté sur votre propre matériel.