La remontada de Codex face à Claude Code : pourquoi le rapport de force a changé
Mike Codeur
2026 a été l’année Claude Code. L’outil d’Anthropic s’est imposé chez les développeurs, puis bien au-delà du cercle des utilisateurs avancés. Son avantage ne venait pas seulement du modèle : Claude Code proposait un environnement cohérent pour travailler dans un dépôt, utiliser le terminal, appeler des outils et faire avancer une tâche jusqu’à sa vérification.
Puis le rapport de force a commencé à changer.
Une partie des développeurs s’est lassée des restrictions, des limites sur certains usages tiers et des frictions autour du mode headless. Pendant ce temps, OpenAI a cessé de traiter Codex comme un simple agent isolé et l’a transformé en véritable plateforme de travail.
Pourquoi Claude Code avait pris l’avance
OpenAI possédait déjà des modèles puissants et la distribution de ChatGPT. Pourtant, l’expérience destinée aux développeurs restait fragmentée.
Anthropic avait mieux assemblé les éléments nécessaires au travail agentique :
- le contexte du dépôt ;
- l’accès au terminal et aux outils ;
- une boucle d’exécution continue ;
- les permissions et validations ;
- la possibilité de déléguer une partie du travail ;
- une interface pensée pour les développeurs.
Le modèle ne suffit pas. Pour livrer du code utilisable, il faut aussi comprendre le projet, modifier les bons fichiers, lancer les tests, lire les erreurs et corriger jusqu’à obtenir une preuve de fonctionnement.
Claude Code avait pris cette avance produit avant Codex.
Comment OpenAI a reconstruit Codex
La remontada n’est pas venue d’un seul benchmark ou d’un nouveau modèle. OpenAI a reconstruit l’environnement autour du modèle.
Codex couvre désormais plusieurs surfaces de travail : CLI, IDE, cloud, application desktop, mobile et SSH. Il réunit le contexte, les outils, les permissions, la mémoire et les agents parallèles dans un même système.
Cette évolution change la manière de travailler. Une tâche peut être déléguée pendant que l’agent principal reste disponible. L’implémentation, les tests et la revue peuvent avancer en parallèle avant de converger.
Dans mon usage quotidien, c’est là que la différence devient visible :
- moins d’attente pendant les délégations ;
- moins de relances manuelles ;
- des boucles plus courtes entre implémentation, revue et correction ;
- une meilleure visibilité sur les tests et les preuves d’exécution.
Je ne présente pas cela comme un benchmark contrôlé. Mes missions sont réelles, mais elles ne sont pas identiques. Je mesure surtout les interruptions qui cassent mon rythme de travail.
Les benchmarks ne donnent pas un gagnant universel
Un benchmark externe cité dans la vidéo montre bien pourquoi il faut éviter les conclusions trop simples.
| Mesure | Claude Code | Codex |
|---|---|---|
| Workflows réussis sur Golden Eval | 47/47 | 45/47 |
| Vitesse dans ce protocole | Référence | Environ 6 % plus rapide |
| Tokens utilisés | Référence | Environ 19 % de moins |
| Coût DeepSWE à réussite égale | 9,18 $ | 3,47 $ |
Dans ce protocole, Claude gagne en fiabilité brute tandis que Codex gagne en efficacité. Le résultat dépend donc de ce que tu optimises : réussite maximale, temps, tokens, coût ou fluidité du travail quotidien.
Là où Claude Code reste devant
Codex est devenu mon choix par défaut pour les correctifs ciblés, les fonctionnalités parallèles et les boucles rapides. Mais je continue d’utiliser Claude Code pour certaines missions.
Pour les audits de centaines de fichiers, les migrations larges et les longues exécutions multi-agents, les Dynamic Workflows de Claude permettent de structurer les étapes, relancer le processus et faire vérifier les résultats par d’autres agents.
Je préfère également Claude pour le Remote Control et la reprise après une coupure. Sa continuité entre terminal, navigateur et téléphone reste plus fiable dans mon utilisation.
Le verdict est donc plus précis que « Codex a battu Claude Code » :
| Mission | Mon choix actuel |
|---|---|
| Correctif ciblé | Codex |
| Fonctionnalités parallèles | Codex |
| Boucle implémentation, revue, tests | Codex |
| Audit massif | Claude Code |
| Migration large | Claude Code |
| Dynamic Workflows | Claude Code |
| Pilotage mobile et reprise après coupure | Claude Code |
La méthode doit survivre au prochain changement de leader
Le leader changera encore. C’est pour cette raison que je conserve le même socle avec les deux outils : user stories, critères d’acceptation, TDD, revue séparée, tests et preuve finale.
Cette méthode permet de changer d’outil sans reconstruire tout le processus. Codex est mon choix par défaut aujourd’hui, mais Claude Code reste meilleur sur certaines missions. Le bon choix dépend du travail à accomplir.
▶️ Regarder la vidéo et comprendre toute la remontada de Codex
Pour recevoir mes prochains retours sur les agents IA et le développement agentique : The Agentic Dev.