Anthropic lance Claude Sonnet 5.5, qui affiche un bond en avant en termes de performances, notamment en matière de codage, plus de 30 % plus rapide et jusqu'à 30 % moins cher par tâche

Anthropic lance Claude Sonnet 5.5, qui obtient un score de 70,6 % au test de codage agentique Terminal-Bench 4.0, contre 10,3 % pour Sonnet 5 et 66,4 % pour Opus 5.5, plus onéreux. Il s’agit du premier Sonnet à intégrer des mesures de sécurité de type « frontier » ainsi que des classificateurs empêchant l’extraction du raisonnement. Selon l’entreprise, Claude Sonnet 5.5 fonctionne plus de 30 % plus rapidement et coûte jusqu’à 30 % moins cher par tâche que son prédécesseur. Son prix est fixé à 2 dollars par million de tokens d’entrée et à 10 dollars par million de tokens de sortie.

Anthropic est une société d'intérêt public américaine spécialisée dans l'intelligence artificielle (IA). Son produit phare est Claude, une série de grands modèles de langage (LLM) propriétaires. En janvier 2021, dans le but de promouvoir la sécurité de l'IA, Anthropic a été fondée par d'anciens membres d'OpenAI. Anthropic développe le LLM Claude en quatre niveaux : Haiku, Sonnet, Opus et Fable. Claude est accessible via un chatbot en ligne, une API et les outils d’Anthropic : Claude Code, Cowork, Design et Science.

Mi-septembre, Anthropic a lancé Claude Opus 5.5, le premier modèle de sa nouvelle gamme Claude 5.5, dont le principal changement réside dans le coût. L'entreprise affirme que ce nouveau modèle d'IA offre des performances équivalentes à celles de Claude Fable 5.1 pour la plupart des tâches, tout en coûtant 40 % moins cher à l'utilisation qu'Opus 5. Il génère également des résultats plus de 30 % plus rapidement que son prédécesseur. Opus 5.5 a été testé avant son lancement par des évaluateurs externes, notamment METR et Frontier Design.

Récemment, Anthropic lance Claude Sonnet 5.5, qui obtient un score de 70,6 % au test de codage agentique Terminal-Bench 4.0, contre 10,3 % pour Sonnet 5 et 66,4 % pour Opus 5.5, plus onéreux. Il s’agit du premier Sonnet à intégrer des mesures de sécurité de type « frontier » ainsi que des classificateurs empêchant l’extraction du raisonnement. Selon l’entreprise, Claude Sonnet 5.5 fonctionne plus de 30 % plus rapidement et coûte jusqu’à 30 % moins cher par tâche que son prédécesseur. Son prix est fixé à 2 dollars par million de tokens d’entrée et à 10 dollars par million de tokens de sortie.

Anthropic indique qu’Opus 5.5 obtient un score de 66,4 % au même test avec son réglage d’effort maximal, et Opus coûte deux fois plus cher par jeton. Sur le test GDPval-AA, qui porte sur 44 métiers, Sonnet 5.5 obtient un score de 1 844, contre 1 846 pour Opus 5.5 et 1 449 pour Sonnet 5. L’entreprise précise qu’Opus reste nettement plus performant pour les tâches ouvertes nécessitant un jugement soutenu.

Anthropic affirme que les capacités du modèle en matière de cybersécurité sont comparables à celles d’Opus 5 ; il est donc lancé avec des restrictions du type de celles qui étaient auparavant réservées à ses modèles les plus performants. Les demandes cyber à haut risque seront systématiquement redirigées vers Sonnet 5. C’est le premier Sonnet à être commercialisé de cette manière, et ses mesures de sécurité liées à la « biologie » restent inchangées.

Il s’agit également du premier Sonnet doté de classificateurs qui bloquent l’extraction du raisonnement, et son système de « thinking » préservé lie le raisonnement d’un modèle au compte qui l’a produit. En août, des chercheurs ont décodé 315 320 blocs de « thinking » à partir de 6 708 traces d’agents publics sur les systèmes d’OpenAI, d’Anthropic et de Google. Ils ont récupéré 62 clés API, 33 mots de passe et sept clés privées.

Anthropic affirme que Sonnet 5.5 ne repousse pas les limites des capacités de ses modèles, ce qui explique pourquoi son évaluation de l’alignement a porté sur un ensemble plus restreint de risques. L’entreprise affirme également que les capacités en matière de cybersécurité constituent une amélioration majeure justifiant des mesures de protection de type « de pointe ». Cette annonce intervient alors qu'en juillet, Anthropic a déclaré que son modèle d’IA Claude avait piraté les systèmes de trois entreprises lors de tests, après qu’une erreur de configuration lui eut donné accès à Internet. Anthropic a précisé que ces incidents concernaient trois modèles distincts : Claude Opus 4.7, Claude Mythos 5 et un modèle de recherche interne. Ces failles indiquaient que les capacités croissantes de l’IA alimentent déjà la menace de sécurité que les experts redoutaient depuis longtemps, et que même les meilleurs développeurs peuvent être pris au dépourvu par des failles que leurs modèles sont capables d’exploiter.

Voici un extrait de l'annonce d'Anthropic :

Présentation de Claude Sonnet 5.5, le deuxième modèle de la gamme Claude 5.5. Il s’agit d’une nette amélioration par rapport à Claude Sonnet 5 : il est 30 % plus rapide et coûte jusqu’à 30 % moins cher pour la plupart des tâches.

Sonnet 5.5 est un complément plus rapide et moins coûteux à Claude Opus 5.5. Alors qu’Opus 5.5 est conçu pour les tâches complexes nécessitant un jugement rigoureux, Sonnet 5.5 excelle dans les tâches quotidiennes bien définies, la correction de bogues et la création de documents, de diapositives et de feuilles de calcul soignés. Il possède également un sens aigu du design. Claude Haiku 5.5, conçu pour les applications à haut volume et sensibles aux coûts, rejoindra la gamme Claude 5.5 dans les semaines à venir.

Sonnet 5.5 apporte des améliorations par rapport à Sonnet 5 sur les points suivants :

Performances. Sonnet 5.5 obtient un score de 70,6 % au Terminal-Bench 4.0, un test d’évaluation du codage agentique, contre 10,3 % pour Sonnet 5. Il obtient un score inférieur de deux points à celui d’Opus 5.5 au GDPval-AA, un test simulant des tâches réelles dans divers métiers. Il excelle également dans les tâches à long terme et la compréhension des images : c’est le premier modèle Sonnet à avoir battu Pokémon Rouge en se basant uniquement sur des captures d’écran.

Collaboration. À l’instar d’Opus 5.5, Sonnet 5.5 rédige de manière plus claire que notre génération précédente de modèles ; les premiers testeurs l’ont décrit comme un meilleur partenaire de collaboration que Sonnet 5. Sa rapidité le rend également bien adapté aux itérations rapides sur des tâches moins complexes.

Coût. Sonnet 5.5 est proposé au même prix que Sonnet 5 : 2 $ par million de jetons d’entrée, 10 $ par million de jetons de sortie et 0,20 $ par million de jetons pour les lectures en cache, mais il nécessite généralement bien moins de jetons pour effectuer le même travail. Lors de nos tests, son coût par tâche s’est avéré jusqu’à 30 % inférieur à celui de son prédécesseur.

Vitesse. Sonnet 5.5 génère des résultats 30 % plus rapidement que Sonnet 5, ce qui en fait notre modèle Sonnet le plus rapide à ce jour.

Alignement et sécurité. Lors de notre audit comportemental automatisé, Sonnet 5.5 a obtenu des résultats supérieurs ou équivalents à ceux de Sonnet 5 pour la plupart des indicateurs d’alignement. Ses capacités en matière de cybersécurité étant comparables à celles d’Opus 5, il s’agit du premier modèle Sonnet à être lancé avec des mesures de protection et des mécanismes de secours similaires à ceux que nous avons développés pour nos modèles les plus performants. Ses mesures de protection en matière de biologie sont identiques à celles de Sonnet 5. Ces deux types de mesures ciblent un ensemble restreint de requêtes à haut risque ; le développement logiciel courant et la plupart des travaux en sciences de la vie ne sont pas affectés.

Performances

Sonnet 5.5 surpasse Sonnet 5 dans tous les domaines, parfois de manière spectaculaire. Lors de plusieurs évaluations, Sonnet 5.5, en mode « Max effort », affiche même des performances comparables à celles d’Opus 5.5. Cependant, les scores des tests de performance ne reflètent qu’une facette des capacités d’un modèle ; d’après nos propres tests et ceux de testeurs externes, Opus 5.5 reste clairement plus performant pour les tâches complexes et ouvertes nécessitant un jugement soutenu.

Les graphiques ci-dessous représentent le score de chaque modèle en fonction de son coût par tâche, pour chaque niveau d’effort. À mesure que l’effort augmente, les modèles fonctionnent généralement plus longtemps, ce qui entraîne un coût par tâche plus élevé, mais aussi, en règle générale, un score plus élevé. Plus un point est proche du coin supérieur gauche du graphique, plus le rapport performances/coût est élevé.

Sur plusieurs tests de performance, Sonnet 5.5, à un niveau d’effort faible ou moyen, bat le meilleur score de Sonnet 5 pour environ un dixième du coût par tâche. Il complète au mieux Opus 5.5 lorsqu’il fonctionne à des niveaux d’effort plus faibles, où il coûte moins cher par tâche. À des niveaux d’effort plus élevés, il peut offrir des performances comparables pour un coût similaire.

Codage

Le bond en avant de Sonnet 5.5 en termes de performances est particulièrement perceptible dans le domaine du codage. Sur FrontierCode, avec un niveau d’effort « High », il obtient un score supérieur de 10 points à celui de Sonnet 5 dans les mêmes conditions, pour un coût par tâche représentant environ un quinzième de celui-ci. Sur CursorBench, qui teste les modèles sur des tâches issues de véritables sessions de codage Cursor, son meilleur score se situe à environ deux points de celui d’Opus 5.5.

Les premiers testeurs ont apprécié la rapidité avec laquelle Sonnet 5.5 parvient à comprendre une base de code. Ils ont également été impressionnés par son efficacité : lors de tests comparatifs, il a regroupé davantage d’appels d’outils que Sonnet 5, ce qui s’est traduit par un nombre d’étapes réduit et des coûts moindres.


Travail intellectuel

Sonnet 5.5 affiche des progrès dans plusieurs domaines du travail intellectuel. Sur le benchmark GDPval-AA, qui évalue les modèles sur des tâches concrètes couvrant 44 métiers et neuf grands secteurs d’activité, Sonnet 5.5 obtient un score presque équivalent à celui d’Opus 5.5 et environ 400 points de plus que Sonnet 5. Il se rapproche d’Opus 5.5 en matière d’utilisation de l’informatique et de reconnaissance de graphiques, et surpasse clairement Sonnet 5 et GPT-6 Sol dans le travail intellectuel à long terme.

Les premiers testeurs ont mis en avant des améliorations moins quantifiables. Ils l’ont trouvé plus naturel dans la conversation et ont souligné son talent pour le design, notant qu’il apporte une touche de raffinement aux interfaces utilisateur et qu’il est capable de suivre des modèles de diapositives pour créer des présentations ne nécessitant qu’un minimum de retouches. Lors d’un test interne, nous lui avons fourni les documents relatifs aux résultats trimestriels et les transcriptions des conférences téléphoniques d’une société cotée en bourse, ainsi qu’un modèle de diapositive, et lui avons demandé de réaliser une synthèse opérationnelle en 10 diapositives. Deux experts ont estimé que sa première ébauche était prête à être envoyée telle quelle.

Coût et rapidité

Sonnet 5.5 nécessite moins de jetons par tâche que Sonnet 5, son exécution est donc moins coûteuse. Il génère également des résultats 30 % plus rapidement, et son efficacité est immédiatement perceptible :

Le réglage du niveau d’effort vous permet de trouver un équilibre entre coût, rapidité et qualité globale. Dans Claude Code et nos applications, le niveau d’effort par défaut est réglé sur « Moyen », tandis que la plateforme Claude est réglée par défaut sur « Élevé ». Avec des réglages plus bas, Claude répond plus rapidement et utilise moins de tokens, ce qui convient aux tâches routinières. Avec des réglages plus élevés, Claude réfléchit plus longtemps et vérifie son travail de manière plus approfondie.

Sécurité

Alignement

Sonnet 5.5 ne repousse pas les limites des capacités de nos modèles ; notre évaluation de l’alignement s’est donc concentrée sur un ensemble ciblé de risques applicables aux modèles de tous niveaux de capacité, notamment le fait d’agir à l’encontre des intérêts des utilisateurs, d’induire les utilisateurs en erreur et de coopérer à des utilisations abusives aux enjeux élevés.

Lors de notre audit comportemental automatisé, qui teste Claude dans environ 1 850 scénarios, Sonnet 5.5 obtient des résultats supérieurs ou équivalents à ceux de Sonnet 5 pour la plupart des indicateurs d’alignement, de résistance aux utilisations abusives et d’honnêteté. Dans nos évaluations de confinement plus récentes, Sonnet 5.5...

La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.