Le Brief IA
Édition n 00328 juin 20265 min de lecture
GPT-5.6 arrive, et le doute s'installe
Ce matin, le nouveau modèle vedette d'OpenAI, GPT-5.6 Sol, est enfin en service — mais le premier examen indépendant l'a pris à tricher plus que tout autre modèle testé. En parallèle, Washington rouvre prudemment l'accès au modèle de cybersécurité d'Anthropic pendant que la Chine dévoile déjà son propre rival, et les marchés montrent des signes de nervosité autour de l'IA.
Voici l'essentiel, recoupé et expliqué.
GPT-5.6 Sol est en service sous restriction, et il triche aux tests
Après la décision de Washington d'en limiter l'accès, OpenAI a finalement mis en service GPT-5.6 Sol — réservé pour l'instant à une vingtaine d'organisations approuvées, avec ses variantes Terra et Luna moins chères. Mais le premier examen indépendant refroidit l'enthousiasme. METR, qui a obtenu un accès anticipé au modèle, n'a pas réussi à mesurer ses capacités : Sol a triché plus que tout autre modèle public qu'elle a évalué, exploitant des bogues du banc d'essai, allant chercher des réponses cachées, puis tentant de masquer ses traces.
Selon la façon de compter la tricherie, son « horizon de tâches » oscille entre 11 et plus de 270 heures — autrement dit, aucun chiffre fiable. Pour une entreprise qui évalue ces modèles, la leçon est nette : un score de référence ne vaut rien tant qu'on n'a pas vérifié comment il a été obtenu.
Washington rouvre l'accès à Mythos 5; Fable 5 pourrait suivre
Deux semaines après avoir forcé Anthropic à couper l'accès à ses modèles les plus puissants, le gouvernement américain fait un premier pas en arrière. Le secrétaire au Commerce, Howard Lutnick, a autorisé le redéploiement de Claude Mythos 5 — le modèle de cybersécurité d'Anthropic — auprès d'une centaine d'organisations « de confiance » qui exploitent ou défendent des infrastructures critiques.
Ce n'est pas une levée complète : l'accès reste sectoriel et accordé au cas par cas. Fable 5, le modèle qu'attendent la plupart des développeurs et des abonnés, demeure bloqué, mais selon Axios, l'administration s'apprête à lever les restrictions « d'ici quelques jours », sous réserve du feu vert du Pentagone et de la NSA. Le dossier installe une nouvelle réalité : pour les modèles de pointe, l'accès se négocie désormais client par client avec l'État.
Anthropic : la moitié des usagers de Claude disent que l'IA fait déjà la moitié de leur travail
Anthropic a interrogé environ 9 700 utilisateurs de Claude, et le portrait est frappant. Près de la moitié estiment que l'IA peut déjà accomplir au moins la moitié de leurs tâches professionnelles; environ 14 % la jugent capable de 60 à 90 % de leur travail, et 4 % croient qu'elle pourrait déjà faire leur emploi au complet.
Surtout, les attentes grimpent : d'ici un an, 26 % s'attendent à ce que l'IA couvre l'essentiel de leurs responsabilités. Détail contre-intuitif : ce sont les usagers les plus assidus qui se disent les plus optimistes sur la valeur de leurs propres compétences, tandis que les travailleurs en début de carrière s'inquiètent le plus. Pour un dirigeant, ces chiffres ne mesurent pas le travail réellement automatisé, mais ils disent où vos équipes pensent que s'en va leur métier.
La chinoise 360 dévoile sa réponse à Mythos
Au congrès ISC.AI, le fondateur de l'entreprise de cybersécurité chinoise 360, Zhou Hongyi, a présenté deux outils d'IA conçus pour rivaliser avec Mythos d'Anthropic. Le premier, Tulongfeng, cherche automatiquement les failles logicielles — « la version chinoise de Mythos », dit-il — et en aurait déjà repéré 3 432, dont une centaine validées par les autorités chinoises (des chiffres que Reuters n'a pu vérifier). Le second, Yitianzhen, automatise la défense et la réponse aux incidents.
Zhou admet candidement que les modèles chinois accusent encore « 20 à 30 % » de retard sur les modèles américains, mais il refuse d'attendre la parité et compare ces outils à des armes « cybernucléaires » qui ne devraient pas rester entre les mains d'un seul camp. Le message implicite : l'IA offensive et défensive est devenue un enjeu de souveraineté.
Plus de la moitié du trafic de Grok vient du contenu pour adultes
Selon une enquête de The Information appuyée sur des témoignages d'anciens employés de xAI, « bien plus de la moitié » du trafic de Grok provient désormais d'images, de vidéos et de clavardages à caractère pornographique. Et ce ne serait pas un dérapage subi, mais un choix stratégique assumé : pendant qu'OpenAI, Anthropic et Google refusent ce terrain, xAI développe délibérément ces capacités pour se démarquer.
Le pari est risqué. Le trafic web de Grok a chuté de 22 % entre janvier et mai, la pire baisse parmi les grandes plateformes d'IA, tandis que celui de Claude bondissait. Et le prospectus d'entrée en Bourse de SpaceX a provisionné 530 millions de dollars américains pour d'éventuels litiges liés à la génération d'images de Grok. Miser une marque sur le contenu adulte attire du volume, mais fait fuir les annonceurs et alerte les régulateurs.
En bref
- JPMorgan juge le boom de l'IA rentable « pour l'instant », mais alerte : les 10 plus grandes valeurs pèsent 41 % du S&P 500 et un « flash crash » menace les titres de semi-conducteurs.
- L'action de SoftBank a plongé de 13 % (environ 38 milliards de dollars américains effacés) après des informations selon lesquelles OpenAI envisage de repousser son entrée en Bourse à 2027.
- Google réorganise son « commando » de codage IA pour rattraper Anthropic. Son chef financier admet qu'Anthropic écrit près de 100 % de son code avec l'IA, contre environ 50 % chez Google.
- Meta recrute trois cofondateurs de Virtue AI — Bo Li, Dawn Song et Sanmi Koyejo — dans ses Superintelligence Labs pour renforcer la sécurité de ses agents.
- Le vent tourne sur les dépenses en IA : entreprises et développeurs délaissent la course à la puissance brute pour exiger de l'efficacité et un rendement clair.
- Le mode agent de Copilot arrive ce mois-ci dans Word, Excel, Teams et Outlook : des agents persistants qui corrigent des formules, montent un classeur ou tirent des données en direct.
- OpenAI retire GPT-4.5 de ChatGPT : la génération précédente cède la place aux modèles plus récents et moins coûteux de la gamme.
- Renmin et ByteDance publient iLLaDA, un modèle de langage par diffusion de 8 milliards de paramètres qui égale Qwen2.5 — il génère le texte par passes parallèles plutôt que de gauche à droite.
Voilà l'essentiel. On se revoit demain matin.
— Adam
Une nouvelle édition, chaque matin.