Test Claude Sonnet 5 : la puissance d'Opus pour moitié prix

·
review claude sonnet anthropic

Je l’ai testé pendant trois jours. Voilà ce que j’en pense.

En bref

Claude Sonnet 5 est sorti le 30 juin 2026. En une phrase : c’est le premier Sonnet qui vous fait sérieusement douter que vous avez besoin d’Opus.

Après nos benchmarks et tests en conditions réelles, le taux de complétion en mode agent de Sonnet 5 colle aux basques d’Opus 4.8 — et parfois l’égale. Pour 40 % du prix.

Si vous êtes encore sur Sonnet 4.6, vous migrez, point. Si vous hésitez à payer pour Opus, Sonnet 5 pourrait vous épargner la dépense.

Ce qui a vraiment changé

De « il sait démarrer » à « il sait finir »

Les Sonnet précédents avaient un défaut bien connu : ils lâchaient en cours de route sur les tâches complexes. Genre, vous demandez un refactoring sur 5 fichiers, il en fait 3 avant de « résumer » et d’attendre un nouveau prompt.

Sonnet 5 corrige largement ça. Les partenaires en accès anticipé signalent tous la même chose — les tâches qui calaient avant vont maintenant jusqu’au bout.

Un exemple concret : un dev a demandé à Sonnet 5 d’investiguer un bug. Sans aucune instruction supplémentaire, le modèle a écrit un test de reproduction, implémenté le fix, mis le fix de côté pour vérifier que le bug revenait, puis restauré le fix et commité. Une seule passe, zéro intervention humaine.

Ce type d’auto-vérification était essentiellement absent de Sonnet 4.6.

Les perfs de code montent d’un cran

Voici les chiffres issus de la publication officielle d’Anthropic :

BenchmarkSonnet 4.6Sonnet 5Opus 4.8
SWE-bench Verified65.3%72.1%75.6%
Terminal-bench43.2%55.7%59.1%
Humanity’s Last Exam (tools)46.8%58.3%66.1%
OSWorld-Verified78.5%88.2%91.4%
BrowseComp39.0%55.8%60.5%

Points clés :

  • SWE-bench Verified passe de 65,3 % à 72,1 %, et se rapproche des 75,6 % d’Opus 4.8. L’écart tient désormais en un seul chiffre.
  • BrowseComp (recherche en mode agent) enregistre le plus gros bond — de 39 % à 55,8 %, soit près de 1,5x d’amélioration.
  • OSWorld-Verified atteint 88,2 %, ce qui confirme que Sonnet 5 est mûr pour l’automatisation navigateur et les tâches de bureau.

Les agents : le vrai argument de vente

Sonnet 5 est présenté comme « le Sonnet le plus performant en mode agent à ce jour ». C’est pas du pipeau — y’a du concret derrière.

Le modèle gère désormais :

  • La planification multi-étapes avec exécution séquentielle
  • La sélection correcte des outils (navigateur, terminal, API) avec stratégies de repli en cas d’échec
  • La cohérence du contexte sur les tâches longues sans « oublier » l’objectif
  • La vérification proactive des résultats sans qu’on lui demande

Anthropic fournit des courbes coût-performance à différents niveaux d’effort. En résumé :

  • En effort moyen, Sonnet 5 offre un bien meilleur rapport qualité/prix que Sonnet 4.6 et Opus 4.8
  • En effort élevé, Sonnet 5 égale Opus 4.8 sur certaines tâches
  • Vous contrôlez ça via le paramètre effort de l’API — effort bas pour les tâches simples et faire des économies, élevé pour les travaux complexes, lourds

Un seul modèle couvre donc tout le spectre, du Q&A simple à l’exécution agentique complexe. Plus besoin de jongler entre trois modèles.

Tarification : la fenêtre de lancement, ça compte

Tarif de lancement (jusqu’au 31 août)Tarif standardOpus 4.8
Input (par 1M tokens)$2$3$5
Output (par 1M tokens)$10$15$25

Détails importants :

  1. Le tarif de lancement expire le 31 août — environ 67 % du prix standard. Si vous prévoyez une migration, lancez les tests maintenant.
  2. Sonnet 5 utilise un nouveau tokenizer qui consomme environ 1,0 à 1,35x plus de tokens pour le même texte. Le tarif de lancement est calibré pour rendre cette transition à peu près neutre en coût.
  3. Combiné avec le cache de prompts (jusqu’à 90 % d’économies) et le traitement par lots (50 % d’économies), les coûts réels peuvent baisser significativement.

Comparé à Opus 4.8, le tarif standard de Sonnet 5 est à 60 % sur l’input comme sur l’output. Vu que l’écart de performance se réduit à quelques points de pourcentage, Sonnet 5 offre un meilleur ROI pour la plupart des workloads.

Sécurité : des progrès mesurables

C’est pas du bla-bla — les données le confirment :

  • Taux d’hallucination inférieur à Sonnet 4.6
  • Moins lèche-bottes que Sonnet 4.6 — il ne vous dit pas ce que vous voulez entendre pour vous faire plaisir
  • Sécurités anti-exploit renforcées — meilleur refus des requêtes malveillantes et résistance à l’injection de prompts
  • Score d’alignement global supérieur à Sonnet 4.6, quoique légèrement en retrait par rapport à Opus 4.8

Point à noter : Sonnet 5 embarque les gardes-fous cyber activés par défaut, comme Opus 4.7 et 4.8. Il ne vous aidera pas à écrire du code d’exploitation. Si vous avez des besoins légitimes de test de sécurité, passez par le Cyber Verification Program d’Anthropic ou utilisez Opus 4.8.

Faut-il passer à Sonnet 5 ?

Migrez maintenant

  • Équipes utilisant Sonnet 4.6 pour des agents/automatisation : l’amélioration en complétion de tâches multi-étapes est décisive.
  • Devs solos utilisant Claude Code : Sonnet 5 est déjà le modèle par défaut sur les plans Free et Pro — vous l’utilisez peut-être déjà.
  • Ceux qui lorgnent Opus mais tiquent sur le prix : testez d’abord Sonnet 5 en effort élevé. Ça pourrait suffire.

À surveiller

  • Équipes déjà sur Opus 4.8 et satisfaites : Opus reste devant en profondeur de raisonnement et sur les tâches les plus coton. Aucune raison de rétrograder.
  • Workflows de tests de cybersécurité : les protections de Sonnet 5 sont restrictives. Opus 4.8 est mieux adapté.

Rien à faire

  • Utilisation occasionnelle / tâches légères : Sonnet 4.6 ou même Haiku font déjà l’affaire.

Où l’utiliser

Sonnet 5 est dispo un peu partout :

  • Claude.ai — Web, iOS, Android. Modèle par défaut pour les utilisateurs Free et Pro
  • Claude Code — Outil de développement en ligne de commande
  • API — Nom du modèle : claude-sonnet-5
  • Plateformes cloud — AWS (Amazon Bedrock), Google Cloud (Vertex AI), Microsoft Foundry

Face à la concurrence

Le marché des LLM en 2026, c’est la jungle. Voici où se situe Sonnet 5 :

ModelPositionInput $/1MOutput $/1MAgentic Strength
Claude Sonnet 5Mid-high versatile$2-3$10-15Strong
Claude Opus 4.8Flagship reasoning$5$25Strongest
GPT-5.5Flagship coding$5$30Strong
DeepSeek V4 ProBudget reasoning$0.44$0.87Medium
GLM-5.2Bilingual coding$0.93$3Medium

Le positionnement de Sonnet 5 est clair : il n’est ni le moins cher, ni le plus puissant, mais il offre le meilleur équilibre entre « assez performant » et « abordable ». Pour les équipes qui ont besoin d’une capacité agent fiable sans claquer le prix des modèles flagship, Sonnet 5 est un des choix les plus sensés de mi-2026.

Le verdict

Le rythme de sorties d’Anthropic n’arrête pas d’accélérer — Sonnet 3.5, 3.6, 3.7, 4, 4.5, 4.6, puis 5. Le saut de numéro de version indique que c’est pas une itération mineure.

Le récit central de Sonnet 5, c’est la « démocratisation des agents ». Les tâches autonomes multi-étapes qui nécessitaient avant un modèle de classe Opus tournent désormais au prix Sonnet. Les implications sur la structure de coûts du développement d’applications IA sont concrètes.

Le tarif de lancement court jusqu’au 31 août. Si vous construisez une forme quelconque d’agent IA, commencez à tester votre migration dès maintenant.