Retour aux articles
vendredi 2 octobre 20260 vues0

Sonnet 5.5 contre Opus 5.5 : ce que montrent 15 projets

Mike Codeur

Anthropic
Claude Code
LLM

Sonnet 5.5 contre Opus 5.5 : ce que montrent 15 projets

▶️ Voir la vidéo complète

Pas le budget pour lancer chaque tâche avec Opus 5.5 ? Sonnet 5.5 est annoncé à un tarif par token deux fois inférieur. Mike a voulu comparer des projets livrés, pas se contenter de cette grille de prix. Il a lancé quinze projets dans Claude Code avec les deux modèles, mêmes prompts et dossiers isolés, sans intervention humaine pendant les runs. Treize ont un résultat terminé des deux côtés : les chiffres ci-dessous ne concernent que ces treize duels.

Ce qui a été comparé

Le banc mêle un trou noir en 3D, une galaxie de particules, une simulation de fluides, une landing page, un configurateur, un dashboard, un jeu de plateforme et une API avec tests, parmi les quinze projets. Ce choix évite de prendre une seule classe de tâche pour une vérité générale : une animation, une interface et une API ne demandent pas le même type de travail.

Pour comparer proprement les sorties, Mike a donné le même prompt à chaque modèle dans des dossiers distincts, au sein du même outil, puis ouvert les réalisations côte à côte. Ce protocole réduit quelques différences de contexte. Il ne prouve ni que toutes les configurations de Claude Code sont équivalentes ni que les résultats s’appliqueront à ton dépôt.

Les treize duels terminés

Mesure, sur les 13 projets communsSonnet 5.5Opus 5.5
Projets livrés et démarrables13/1313/13
Projets dont les tests passent13/1312/13
Durée cumulée des runs34 min 012 h 15
Coût équivalent API sur ces runs4,52 $26,34 $
Tests écrits128222

Ces durées sont celles des runs observés dans cette expérience, pas une promesse de temps de livraison pour un autre projet. Les dollars sont des coûts équivalents API calculés pour ces runs : ils ne représentent ni une facture d’abonnement Claude Code ni le coût du travail humain de revue. Le nombre de tests écrits n’est pas un score de qualité ; il décrit une différence visible dans les livrables.

Les deux projets que le tableau ne doit pas absorber

Le run Opus s’est arrêté avant la fin des projets 14 et 15. Sonnet dispose d’un résultat, mais il n’y a pas de duel complet. Les compter comme deux victoires Sonnet fausserait le dénominateur. À l’inverse, un projet qui démarre et dont les tests passent n’est pas forcément une bonne interface ou une bonne architecture. La vidéo ouvre les démos et le code pour que tu puisses juger ce que chaque modèle a réellement produit.

Tarif par token et coût du résultat

Le prix affiché de Sonnet 5.5 était de 2 $ par million de tokens d’entrée et 10 $ en sortie, selon la documentation Anthropic ; le tarif par token d’Opus 5.5 était deux fois plus élevé. Mais pour choisir un modèle de travail, il faut aussi compter les tokens de raisonnement, le cache, les appels d’outils, les essais ratés, le temps écoulé et les corrections humaines. Un modèle meilleur marché par token peut perdre son avantage s’il multiplie les tours ou laisse un résultat inexploitable.

Les benchmarks de fournisseurs et d’évaluateurs externes utilisent parfois des niveaux d’effort et des environnements différents. Le score Terminal-Bench mis en avant pour Sonnet à max, par exemple, ne doit pas être comparé à un score Opus en xhigh comme si tous les paramètres étaient alignés. Mike présente donc ses projets comme une expérience située, pas comme un classement universel des modèles.

Comment choisir pour ton propre travail

  1. Prends quelques tâches représentatives de ton dépôt : une interface, un bug et une fonctionnalité testée.
  2. Fige le prompt, l’état initial du dépôt, les droits et les critères d’acceptation.
  3. Mesure les runs terminés, le temps, le coût complet et la correction nécessaire après revue.
  4. Ouvre les résultats : interactions, comportements limites et tests valent autant qu’un tableau de scores.
  5. Si une tâche ne finit pas dans les deux configurations, note-la séparément au lieu de forcer un pourcentage de victoire.

Sur ces treize duels, Sonnet s’est montré plus rapide et moins cher en coût équivalent API. La vidéo te permet de voir les réalisations avant de décider si ce compromis te convient, ou si tu préfères confier certaines tâches plus ouvertes à Opus.

Rejoins The Agentic Dev pour les prochains tests de modèles et workflows de développement.

Rejoins The Agentic Dev

Chaque semaine : outils, workflows et stratégies pour coder avec les agents IA comme un pro.

Workflows agentic testés en prod
Outils IA qui marchent vraiment
+35 000 développeurs déjà inscrits

Gratuit · 1 email / semaine · +1250€ de formations offertes