Le Brief IA
Édition n 02525 juillet 20265 min de lecture
Opus 5 rebat les cartes du prix de l'IA de pointe
Ce matin, un même fil relie presque toutes les nouvelles : l'IA de pointe devient nettement moins chère. Anthropic lance Opus 5 à la moitié du prix de son haut de gamme, un routeur japonais prétend battre les meilleurs modèles sans en posséder un seul, et un modèle chinois ultra-frugal égale un système mille fois plus gros.
Voici l'essentiel, recoupé et expliqué.
Anthropic lance Opus 5 : la performance de pointe à moitié prix
Anthropic a sorti Claude Opus 5, un modèle qui approche son fleuron Fable 5 pour deux fois moins cher. Le tarif reste celui d'Opus 4.8 — 5 dollars par million de jetons en entrée, 25 dollars en sortie — soit la moitié des 10 et 50 dollars de Fable 5.
Sur les tests internes, Opus 5 domine le Frontier-Bench, se tient à 0,5 % de Fable 5 sur CursorBench pour la moitié du coût, et triple le meilleur rival sur l'épreuve de raisonnement ARC-AGI 3. Un réglage d'effort permet d'arbitrer entre profondeur et facture, et un mode rapide tourne environ 2,5 fois plus vite au double du prix.
Pour une PME, le calcul change : de la performance de premier plan devient abordable, et le curseur d'effort laisse payer seulement pour la profondeur dont on a besoin.
Sakana dit battre le haut de gamme avec un simple routeur
Le laboratoire japonais Sakana AI a mis à jour Fugu-Ultra, un routeur qui ne possède aucun modèle : il répartit chaque requête sur une réserve de modèles publics de premier plan et choisit le meilleur pour la tâche. La version 1.1 revendique jusqu'à 7,9 points de mieux que la précédente, surtout sur ProgramBench et TerminalBench, et affirme dépasser Fable 5 sans même l'inclure dans sa réserve. Le prix ne bouge pas : 5 dollars par million de jetons en entrée, 30 en sortie.
Une réserve s'impose : ces chiffres viennent de Sakana, sans vérification indépendante à ce jour.
Le message pour les bâtisseurs est clair : nul besoin de posséder un modèle de pointe pour en vendre la performance. L'orchestration banalise la couche modèle — mais les promesses non recoupées se prennent avec prudence.
Kimi K3 décroche sur la cyberoffensive, et la distillation pourrait l'expliquer
Les instituts publics de sécurité de l'IA britannique et américain ont évalué le modèle chinois Kimi K3 sur la cyberoffensive. Le verdict est net : 32,2 % de réussite sur ExploitBench, contre 76,2 % pour les meilleurs modèles américains ; sur l'épreuve « The Last Ones », il atteint en moyenne l'étape 17 sur 32, là où les systèmes de tête vont jusqu'à 28,5.
Les évaluateurs avancent une hypothèse. Si Kimi K3 a surtout appris à partir de sorties de Claude — comme l'a affirmé le conseiller américain Michael Kratsios —, les garde-fous d'Anthropic qui bloquent les requêtes cyberoffensives auraient laissé ces compétences sous-représentées.
Pour qui compare les modèles, la leçon compte : la faiblesse d'un modèle bon marché est spécifique à la tâche, pas uniforme.
Amazon ouvre Alexa+ au protocole MCP : les agents entrent dans le salon
Amazon adopte le protocole MCP (Model Context Protocol) pour Alexa+. Concrètement, une marque peut apporter son propre serveur MCP et transposer ses outils dans l'assistant. « Alexa+ for Builders » inspecte le serveur, propose un chemin d'intégration et renvoie un paquet prêt à tester en simulateur.
Canva, Headspace, Lyft, Priceline et Virgin Atlantic figurent parmi les premiers services branchés. En toile de fond, le protocole s'installe partout : plus de 10 000 serveurs MCP publics tournent en production et les téléchargements mensuels du kit dépassent 97 millions.
Pour un développeur, l'intérêt est direct : MCP devient la prise standard des agents, maintenant jusque dans le matériel grand public. Une seule intégration bien faite peut rejoindre plusieurs assistants d'un coup.
Ant sort Ling-3.0-Flash : 124 milliards de paramètres, 5 milliards actifs
Inclusion AI, la division IA d'Ant Group, a lancé Ling-3.0-Flash : 124 milliards de paramètres au total, mais seulement 5,1 milliards actifs par jeton. Sur 11 tests sur 12, il égale ou dépasse le propre fleuron du groupe, un modèle de mille milliards de paramètres, avec un douzième des paramètres actifs.
Le modèle mise sur une attention hybride et une activation d'un expert sur soixante-quatre pour réduire le calcul ; il tient 256 000 jetons de contexte, jusqu'à un million. Il n'y a pas de poids publiés : l'accès passe par l'interface de programmation, gratuit sur OpenRouter jusqu'au 3 août.
Pour qui fait tourner beaucoup d'agents en parallèle, cette activation ultra-frugale rogne directement la facture de calcul.
Un doctorant règle six problèmes d'Erdős en cinq jours avec GPT-5.6
Shouqiao Wang, doctorant à l'Université Columbia, affirme avoir résolu six problèmes ouverts d'Erdős en cinq jours à l'aide de GPT-5.6 Sol et du flux Codex. Sur treize tentatives, six ont abouti — un taux de succès proche de 46 % —, dont une qui a tourné 32 heures d'affilée.
Sa méthode tient moins au modèle qu'à la rigueur de la consigne. Il rédige la requête comme un contrat : il reformule le problème, précise ce qu'une preuve complète doit établir, énumère les résultats plus faibles qui ne comptent pas et signale d'avance les pièges connus.
Pour quiconque met l'IA sur un travail difficile et vérifiable, la leçon est transférable : le gain vient d'abord d'une spécification disciplinée.
En bref
- Le Delaware étudie une personnalité juridique pour les entreprises pilotées par des IA, afin d'encadrer les sociétés autonomes avant qu'elles ne se multiplient.
- La Chambre des représentants américaine avance un projet interdisant les robots humanoïdes chinois à l'armée, sur fond de rivalité technologique.
- Tesla filme ses ouvriers avec des caméras-sacs à dos à son usine de Grünheide pour entraîner le robot Optimus aux gestes d'assemblage.
- Grok Build, de xAI, répartit une tâche sur des centaines d'agents en parallèle, avec scripts d'orchestration et vérifications sceptiques automatiques.
- ElevenLabs analyse désormais chaque piste de référence téléversée pour bloquer le contenu protégé dans son générateur de musique.
- Google élargit l'accès à Gemini Spark, son atelier pour créer des mini-applications IA sans écrire de code.
- Google ajoute une connexion par vidéo-selfie pour déjouer les arnaques de récupération de compte fondées sur l'hypertrucage.
- Le rover de Lunar Outpost embarquera une puce Jetson de Nvidia : un premier GPU à la surface de la Lune, pour piloter son lidar de navigation.
- Le géant du recrutement Adecco juge que l'IA ne provoquera pas d'effondrement de l'emploi, malgré les coupes annoncées ailleurs dans la tech.
C'est tout pour ce matin. Bon samedi, et à demain. — Adam
Une nouvelle édition, chaque matin.