Test Claude Sonnet 5 : la puissance d'Opus pour moitié prix
Je l’ai testé pendant trois jours. Voilà ce que j’en pense.
En bref
Claude Sonnet 5 est sorti le 30 juin 2026. En une phrase : c’est le premier Sonnet qui vous fait sérieusement douter que vous avez besoin d’Opus.
Après nos benchmarks et tests en conditions réelles, le taux de complétion en mode agent de Sonnet 5 colle aux basques d’Opus 4.8 — et parfois l’égale. Pour 40 % du prix.
Si vous êtes encore sur Sonnet 4.6, vous migrez, point. Si vous hésitez à payer pour Opus, Sonnet 5 pourrait vous épargner la dépense.
Ce qui a vraiment changé
De « il sait démarrer » à « il sait finir »
Les Sonnet précédents avaient un défaut bien connu : ils lâchaient en cours de route sur les tâches complexes. Genre, vous demandez un refactoring sur 5 fichiers, il en fait 3 avant de « résumer » et d’attendre un nouveau prompt.
Sonnet 5 corrige largement ça. Les partenaires en accès anticipé signalent tous la même chose — les tâches qui calaient avant vont maintenant jusqu’au bout.
Un exemple concret : un dev a demandé à Sonnet 5 d’investiguer un bug. Sans aucune instruction supplémentaire, le modèle a écrit un test de reproduction, implémenté le fix, mis le fix de côté pour vérifier que le bug revenait, puis restauré le fix et commité. Une seule passe, zéro intervention humaine.
Ce type d’auto-vérification était essentiellement absent de Sonnet 4.6.
Les perfs de code montent d’un cran
Voici les chiffres issus de la publication officielle d’Anthropic :
| Benchmark | Sonnet 4.6 | Sonnet 5 | Opus 4.8 |
|---|---|---|---|
| SWE-bench Verified | 65.3% | 72.1% | 75.6% |
| Terminal-bench | 43.2% | 55.7% | 59.1% |
| Humanity’s Last Exam (tools) | 46.8% | 58.3% | 66.1% |
| OSWorld-Verified | 78.5% | 88.2% | 91.4% |
| BrowseComp | 39.0% | 55.8% | 60.5% |
Points clés :
- SWE-bench Verified passe de 65,3 % à 72,1 %, et se rapproche des 75,6 % d’Opus 4.8. L’écart tient désormais en un seul chiffre.
- BrowseComp (recherche en mode agent) enregistre le plus gros bond — de 39 % à 55,8 %, soit près de 1,5x d’amélioration.
- OSWorld-Verified atteint 88,2 %, ce qui confirme que Sonnet 5 est mûr pour l’automatisation navigateur et les tâches de bureau.
Les agents : le vrai argument de vente
Sonnet 5 est présenté comme « le Sonnet le plus performant en mode agent à ce jour ». C’est pas du pipeau — y’a du concret derrière.
Le modèle gère désormais :
- La planification multi-étapes avec exécution séquentielle
- La sélection correcte des outils (navigateur, terminal, API) avec stratégies de repli en cas d’échec
- La cohérence du contexte sur les tâches longues sans « oublier » l’objectif
- La vérification proactive des résultats sans qu’on lui demande
Anthropic fournit des courbes coût-performance à différents niveaux d’effort. En résumé :
- En effort moyen, Sonnet 5 offre un bien meilleur rapport qualité/prix que Sonnet 4.6 et Opus 4.8
- En effort élevé, Sonnet 5 égale Opus 4.8 sur certaines tâches
- Vous contrôlez ça via le paramètre
effortde l’API — effort bas pour les tâches simples et faire des économies, élevé pour les travaux complexes, lourds
Un seul modèle couvre donc tout le spectre, du Q&A simple à l’exécution agentique complexe. Plus besoin de jongler entre trois modèles.
Tarification : la fenêtre de lancement, ça compte
| Tarif de lancement (jusqu’au 31 août) | Tarif standard | Opus 4.8 | |
|---|---|---|---|
| Input (par 1M tokens) | $2 | $3 | $5 |
| Output (par 1M tokens) | $10 | $15 | $25 |
Détails importants :
- Le tarif de lancement expire le 31 août — environ 67 % du prix standard. Si vous prévoyez une migration, lancez les tests maintenant.
- Sonnet 5 utilise un nouveau tokenizer qui consomme environ 1,0 à 1,35x plus de tokens pour le même texte. Le tarif de lancement est calibré pour rendre cette transition à peu près neutre en coût.
- Combiné avec le cache de prompts (jusqu’à 90 % d’économies) et le traitement par lots (50 % d’économies), les coûts réels peuvent baisser significativement.
Comparé à Opus 4.8, le tarif standard de Sonnet 5 est à 60 % sur l’input comme sur l’output. Vu que l’écart de performance se réduit à quelques points de pourcentage, Sonnet 5 offre un meilleur ROI pour la plupart des workloads.
Sécurité : des progrès mesurables
C’est pas du bla-bla — les données le confirment :
- Taux d’hallucination inférieur à Sonnet 4.6
- Moins lèche-bottes que Sonnet 4.6 — il ne vous dit pas ce que vous voulez entendre pour vous faire plaisir
- Sécurités anti-exploit renforcées — meilleur refus des requêtes malveillantes et résistance à l’injection de prompts
- Score d’alignement global supérieur à Sonnet 4.6, quoique légèrement en retrait par rapport à Opus 4.8
Point à noter : Sonnet 5 embarque les gardes-fous cyber activés par défaut, comme Opus 4.7 et 4.8. Il ne vous aidera pas à écrire du code d’exploitation. Si vous avez des besoins légitimes de test de sécurité, passez par le Cyber Verification Program d’Anthropic ou utilisez Opus 4.8.
Faut-il passer à Sonnet 5 ?
Migrez maintenant
- Équipes utilisant Sonnet 4.6 pour des agents/automatisation : l’amélioration en complétion de tâches multi-étapes est décisive.
- Devs solos utilisant Claude Code : Sonnet 5 est déjà le modèle par défaut sur les plans Free et Pro — vous l’utilisez peut-être déjà.
- Ceux qui lorgnent Opus mais tiquent sur le prix : testez d’abord Sonnet 5 en effort élevé. Ça pourrait suffire.
À surveiller
- Équipes déjà sur Opus 4.8 et satisfaites : Opus reste devant en profondeur de raisonnement et sur les tâches les plus coton. Aucune raison de rétrograder.
- Workflows de tests de cybersécurité : les protections de Sonnet 5 sont restrictives. Opus 4.8 est mieux adapté.
Rien à faire
- Utilisation occasionnelle / tâches légères : Sonnet 4.6 ou même Haiku font déjà l’affaire.
Où l’utiliser
Sonnet 5 est dispo un peu partout :
- Claude.ai — Web, iOS, Android. Modèle par défaut pour les utilisateurs Free et Pro
- Claude Code — Outil de développement en ligne de commande
- API — Nom du modèle :
claude-sonnet-5 - Plateformes cloud — AWS (Amazon Bedrock), Google Cloud (Vertex AI), Microsoft Foundry
Face à la concurrence
Le marché des LLM en 2026, c’est la jungle. Voici où se situe Sonnet 5 :
| Model | Position | Input $/1M | Output $/1M | Agentic Strength |
|---|---|---|---|---|
| Claude Sonnet 5 | Mid-high versatile | $2-3 | $10-15 | Strong |
| Claude Opus 4.8 | Flagship reasoning | $5 | $25 | Strongest |
| GPT-5.5 | Flagship coding | $5 | $30 | Strong |
| DeepSeek V4 Pro | Budget reasoning | $0.44 | $0.87 | Medium |
| GLM-5.2 | Bilingual coding | $0.93 | $3 | Medium |
Le positionnement de Sonnet 5 est clair : il n’est ni le moins cher, ni le plus puissant, mais il offre le meilleur équilibre entre « assez performant » et « abordable ». Pour les équipes qui ont besoin d’une capacité agent fiable sans claquer le prix des modèles flagship, Sonnet 5 est un des choix les plus sensés de mi-2026.
Le verdict
Le rythme de sorties d’Anthropic n’arrête pas d’accélérer — Sonnet 3.5, 3.6, 3.7, 4, 4.5, 4.6, puis 5. Le saut de numéro de version indique que c’est pas une itération mineure.
Le récit central de Sonnet 5, c’est la « démocratisation des agents ». Les tâches autonomes multi-étapes qui nécessitaient avant un modèle de classe Opus tournent désormais au prix Sonnet. Les implications sur la structure de coûts du développement d’applications IA sont concrètes.
Le tarif de lancement court jusqu’au 31 août. Si vous construisez une forme quelconque d’agent IA, commencez à tester votre migration dès maintenant.