Les derniers avancements de l'IA générative 🤯
5 août 2026
Écouter sur :
Aujourd'hui, on analyse les derniers avancements de l'IA générative : un modèle d'OpenAI vient de résoudre 10 problèmes de mathématiques, un autre a hacké Hugging Face durant une évaluation. De l'autre côté, les modèles open source chinois continuent de challenger les modèles « frontier ».
Rejoignez le serveur Discord pour discuter du podcast et de son évolution : https://discord.gg/CqUzSvEkB
À bientôt,
Guillaume
Transcription brute générée automatiquement par Whisper — peut contenir des imprécisions.
Transcription
Bonjour à tous et bienvenue dans ce nouvel épisode de Génération IA. Aujourd'hui, un nouvel épisode pour vous parler des avancements et des développements de l'intelligence artificielle. On va revenir notamment sur l'épisode précédent qui s'appelle la guerre de l'intelligence avec les Etats-Unis d'un côté et la Chine de l'autre. Mais plus globalement, c'est une guerre entre les modèles open source et les modèles closed source. Et c'est les modèles open source qui sont en train de gagner cette guerre.
Je vais tout vous expliquer, on va reprendre plusieurs nouvelles. Mais tout d'abord, si ce podcast vous plaît les amis, n'hésitez pas à mettre 5 étoiles au podcast, c'est très très important. Je travaille beaucoup et je build beaucoup. Il faut dire que c'est très difficile de suivre toute l'actualité, toutes les news dans le monde de l'intelligence artificielle. Et moi-même qui build tous les jours avec l'intelligence artificielle et qui passe ma vie à lire des news et à tester des outils, je n'arrive plus à suivre. Ça fait bien longtemps en fait que je n'arrive plus à tout suivre. J'essaye de focaliser sur l'essentiel.
D'où l'importance de ce podcast car l'information, il y en a énormément, il faut savoir trier. Et c'est ce que j'essaye de faire modestement ici. En parlant des choses vraiment les plus importantes. Il y a énormément de bruit et il y a énormément de bruit qui fait qu'on loupe en fait les informations primordiales. Et du coup, c'est important de se poser, de revenir là-dessus. Si vous êtes en vacances, je vous souhaite de très bonnes vacances. Installez-vous confortablement pour ce nouvel épisode de Génération IA.
Je vais moi-même prendre des vacances. C'est, je pense, essentiel également parce que lorsqu'on bulle, build avec l'IA, il y a comme une espèce de charge mentale. Notre cerveau n'arrive plus à suivre. Il y a le contexte des IA. Il y a le contexte que l'on a dans la tête. Et c'est ce que disent certaines personnes de la Silicon Valley. L'élément limitant du développement avec l'IA n'est plus l'IA elle-même, mais notre cerveau, l'humain. C'est difficile de switcher entre plusieurs instances d'agents qui codent ou qui font autre chose, qui travaillent. On doit tout le temps switcher de contexte. C'est un peu comme quand on regarde des TikTok. Notre cerveau s'habitue à très vite changer de contexte. Et du coup, on n'arrive plus à rester concentré sur la même tâche longtemps.
Honnêtement, je comprends ceux qui sont en monotâche. Je fais moi-même parfois des sessions monotâches afin de garder ma concentration et de comprendre. Les choix architecturaux de l'IA. Car souvent, on ne suit plus du tout. On approuve ou on rejette une proposition faite par l'IA. Bien que souvent, on accepte la proposition recommandée. Et on perd la main sur l'architecture globale. Ce qui en soit est à la fois un problème et pas un problème.
Et honnêtement, je ne sais pas encore si ça l'est ou pas. C'est-à-dire que... Quand on perd la main... Quand on perd la main sur l'architecture, on n'en est plus maître. Et notre rôle, en fait, s'efface. On dépend entièrement de l'IA ensuite pour coder. Et la guide, même plus, c'est elle qui nous guide. Ou qui nous explique ce qu'elle fait. Mais à la fois, est-ce que c'est vraiment grave si on perd le contrôle sur l'architecture, si l'IA est elle-même devenue tellement forte et bien meilleure que nous, qu'elle fait des meilleurs choix que nous? C'est là tout le paradoxe de l'intelligence artificielle. Et du fait de coder avec l'intelligence artificielle. Je parle beaucoup de code parce que c'est là où vraiment elle excelle. Et c'est là où moi, j'ai découvert cette puissance. Et donc, ça m'a poussé à faire ce podcast l'année dernière.
Il y a beaucoup de gens qui ne codent pas, qui ont mis beaucoup plus de temps à réaliser la puissance de l'intelligence artificielle. Et il y a encore beaucoup de gens qui ne réalisent pas. Je pense sincèrement que nous sommes encore en avance. Si vous écoutez ce podcast, vous êtes largement en avance sur 90% des gens. Bien qu'on voit que beaucoup de gens utilisent des emmets, ChatGPT, etc.
Mais ChatGPT, si vous voulez, là, on est bien au-delà. Là, on est sur des agents qui travaillent. ChatGPT a fusionné d'ailleurs avec Codex, leur application code. Et maintenant, dans ChatGPT, vous avez une partie work. Vous pouvez, lui, faire travailler avec des fichiers. Et donc, c'est... C'est une version boostée de ChatGPT pour effectuer des tâches. C'est en fait un... Un harness, on appelle ça. Exactement comme Claude Code ou Claude Cowork, si vous travaillez sur l'application bureau de Claude. Mais il y en a de plus en plus. Et d'ailleurs, mon avis, c'est que les harness vont être découplés des modèles. Claude Code, c'est une anomalie. C'est un harness. C'est un harness qui est développé par le développeur de modèles anthropiques.
Donc, Claude Code s'associe avec les modèles anthropiques particulièrement bien. Bien que vous pouvez aussi utiliser Claude Code avec d'autres modèles. Mais vous avez d'autres harness de code comme OpenCode. Et vous en avez, en fait, des milliers. Il y en a de plus en plus. Par exemple, Grok, l'entreprise fondée par Elon Musk. Enfin, xAI plutôt. Ou SpaceX AI maintenant. Car SpaceX a fusionné avec xAI. Et ils ont racheté Cursor d'ailleurs. Qui est aussi un autre harness.
Grok a mis en open source son harness Grok Build. Il est assez puissant. Et on a désormais des benchmarks qui tournent sur les harness. En plus des benchmarks qui tournent sur les modèles. Parce que vous pouvez évaluer des modèles. Et trouver lequel est le meilleur. Mais si votre agent n'est pas... Le meilleur. En fait, votre modèle peut sous-performer un autre modèle qui a un meilleur harness. Donc, un modèle égal. On peut évaluer les harness. Et les différences sont monumentales parfois. Ça peut aller du x10 par exemple. En termes de temps, durée d'exécution pour une tâche. Après, c'est quand même assez difficile à évaluer. Parce que la complétion d'une tâche. En fait, il y a des subtils. Il y a des subtils dans l'évaluation. Est-ce que l'agent a bien réussi cette tâche ou pas? J'en ai peut-être déjà parlé.
Mais l'entreprise Cognition qui a créé l'agent Devin. A créé un propre benchmark qui je trouve est très intéressant. C'est un benchmark qui évalue des agents sur leur capacité à fusionner une pool request. Dans un répertoire GitHub public. En gros, ça permet... Avant, on évaluait l'agent sur... Un test unitaire. C'est-à-dire, est-ce que tu arrives à faire ça? Oui ou non? C'est déterministe. Le résultat. Et là, ça prend en compte beaucoup plus de facteurs. Parce que sur GitHub, les maintainers. Ceux qui maintiennent les répertoires. Vont évaluer votre pool request. Donc une pool request, c'est du code que vous soumettez à ce répertoire. Pour être fusionné dans le répertoire. Donc vous contribuez à ce projet.
Ceux qui maintiennent ce projet vont évaluer cette pool request sur... Beaucoup d'éléments. Et pas uniquement, est-ce que le code fonctionne? Ça peut être... Est-ce que l'architecture du code est adaptée? Est-ce que c'est pas surcomplexifié par rapport à ce que ça doit faire? Est-ce que votre code... Le style matche avec le style du projet? Est-ce qu'il est bien commenté? Documenté? Selon les recommandations du projet? Bref. C'est beaucoup plus subtil. Et ça... Mets en compte une notion qui est le taste, le goût. Et là encore, le taste est quelque chose dont on parle beaucoup. Et dont certaines IA ne disposent pas forcément. Ou peu par rapport à certains êtres humains. Alors il y a des êtres humains qui n'en ont pas également.
Mais le taste est très important. C'est Steve Jobs qui disait dans une interview. Qu'il avait un problème avec Microsoft. C'est que Microsoft n'a aucun goût. Mais il mérite totalement leur succès. Mais les produits de Microsoft n'ont pas de culture, n'ont pas de goût. Et je trouvais ça assez bien trouvé. Aujourd'hui, vous voyez beaucoup de produits et de plus en plus de SaaS, de websites, de sites internet, pardon, qui sont vibe-codés, c'est-à-dire qui sont faits avec de l'IA. Et il n'y a aucun problème à faire des sites avec de l'IA.
Le truc, c'est que personnellement, ben, je reconnais des... des patterns dans ces sites. C'est-à-dire que je vais voir tout de suite s'il a été fait rapidement avec de l'IA ou si quelqu'un a eu des subtilités, a mis sa patte pour que ça ne ressemble pas à tous les sites faits en imprompte avec de l'IA. C'est-à-dire souvent un fond de couleur violette et même dans les boutons, etc. Ça saute aux yeux que le site est fait directement avec de l'IA.
Et je devais... Je deviens allergique à ça. Je ne sais pas si vous, c'est la même chose. C'est ce qu'on appelle de l'IA slope. C'est en fait... On a donné un prompt à Claude. Il l'a fait. On ne l'a jamais guidé, dirigé, itéré, challengé. Et parfois, c'est suffisant. Mais je trouve de plus en plus important d'apporter du goût dans ses produits, d'apporter du design. Parce que c'est devenu tellement facile de faire des sites ou de faire des SaaS. Que le faire bien, le faire beau, devient une façon de se démarquer. La production de code, le coût du code s'effondre. Mais maintenant, ce qui compte, c'est coder la bonne chose.
Et ça, c'est beaucoup plus difficile. Je travaille actuellement avec deux Français qui ont créé une startup qui s'appelle Manifest. Et c'est vrai qu'on change parfois de stratégie. Et donc, il faut... s'adapter et... il faut coder la bonne chose. C'est-à-dire que parfois, on fait le choix de ne pas coder certaines fonctionnalités qui sont pourtant réclamées par des utilisateurs. Et le commun des mortels trouverait ça logique de passer une heure dessus et de le faire.
Mais il est important parfois de ne pas le faire. Et c'est très difficile de ne pas le faire parce que c'est très addictif de vibe-coder et de coder. Construire des choses avec l'IA, c'est presque une addiction. Je considère parfois que c'est comme un jeu vidéo. C'est-à-dire que sur mon temps ou avant de jouer aux jeux vidéo, depuis plus d'un an, je ne joue plus du tout. Mais j'utilise ce temps de distraction pour construire des apps qui m'amusent. Mais je distingue ça vraiment en divertissement, en distraction de mon vrai travail qui, lui, implique du code. Mais par contre, pas foncer tête baissée, mais prendre du recul, parler de stratégie, analyser, marketing, distribution, etc. Go to market. Puis, on construit la bonne chose.
On ne passe pas notre temps, on ne perd pas notre temps à faire mille fonctionnalités si on ne les a pas décidées, validées avec le marché, avec les utilisateurs et même dans la stratégie globale. Donc, voilà. Je pars un peu dans tous les sens, mais c'est ce que j'aime avec ce podcast. C'est vraiment un temps presque de méditation, mais un temps où, voilà, on est à la plage, on est en voiture et on essaye d'assimiler certaines parties.
Parfois, ce que je dis, ça va vous faire penser à quelque chose que vous avez vu et donc ça va vous rappeler certaines choses. Peut-être que ça va piquer votre curiosité et que vous allez creuser le sujet plus tard. Peut-être qu'il y a des choses qui ne vous intéressent pas, mais c'est toujours cool d'écouter. Donc, voilà. Je voulais parler de toute cette accélération de l'IA qu'il y a eu récemment et ça devient presque le nombre de modèles qui sortent, le nombre de providers, donc d'entreprises qui développent ces modèles. Ça devient inimaginablement grand.
Et on ne les connaît pas tous, aucun de nous ne connaît tous ceux qui font des modèles. J'en connais pas mal, il se trouve, parce qu'on a fait une AI Gateway, donc une plateforme où on peut connecter tous ces modèles et tous ces providers, même si maintenant on n'est plus vraiment là-dessus. Mais j'en ai ajouté pas mal. Et ce que je distingue, c'est vraiment qu'il y a deux catégories, les modèles open source et les modèles qui ne le sont pas.
Pourquoi c'est si important? Parce que le modèle open source, vous pouvez le déployer sur votre propre infrastructure. Mais ça reste un peu compliqué. Donc bien souvent, un fournisseur peut déployer des modèles open source sur son infrastructure et vous, vous l'utilisez pour faire tourner ces modèles-là et votre IA et vous décidez d'où le modèle est hébergé et de la politique de confidentialité de vos données, à savoir que vos données ne sont pas utilisées pour l'entraînement. En fait, vous avez zéro data retention, c'est-à-dire que vos données, elles sont juste utilisées pour l'appel API dans le modèle, en gros.
Mais derrière, c'est tout, on ne les stocke même pas. Et ça, c'est un... c'est une demande qui est de plus en plus insistante des grandes entreprises parce que les fournisseurs d'IA comme Anthropic, par exemple, eh bien, ont été un peu pris la main dans le sac comme quoi ils piquent le business de leur propre client. C'est-à-dire que si vous avez une entreprise que vous envoyez vos données au modèle d'Anthropic, sachez que Anthropic a toutes ces données et comme c'est des données conversationnelles et même qu'il y a tout votre code, etc. qui part, ils peuvent en faire n'importe quoi. Ils peuvent les revendre, ils peuvent les analyser et construire un concurrent.
C'est un peu ce qui s'est passé avec Claude Design, par exemple, qui a été lancé, ce qui a fait baisser la cote en bourse de l'entreprise Figma de près de 50%, je crois. Mais Anthropic s'est attaqué à plein d'autres verticales comme ça. Et donc, la logique des choses veut vraiment que les modèles open source soient de plus en plus populaires, ce qui nourrit tout l'écosystème open source et ce qui fait que ceux qui bâtissent ces modèles, ils gagnent aussi de l'argent parce qu'ils peuvent aussi héberger leurs propres modèles open source sur leur propre infrastructure et faire payer les coûts API.
Donc, ils gagnent beaucoup d'argent, ils peuvent avoir des contrats en B2B. Donc, en fait, c'est un cercle vertueux. Les entreprises qui build, qui construisent en open source vont grossir et parfois grossir plus que les entreprises qui construisent en circuit fermé. Elles auront aussi plus de feedback sur leur modèle, sur l'adoption, plus d'adoption sur ceux qui les déploient en self-hosted. Bref, et c'est pour ça que souvent, on ne va pas se le cacher, ceux qui build en open source, c'est ceux qui sont un peu derrière dans la course. Historiquement, les Chinois, ils sortent leur modèle open source, Mistral aussi le faisait parce que c'était entre OpenAI qui faisait les frontières models, donc les meilleurs modèles d'IA.
Et forcément, quand vous voulez les rattraper, vous utilisez la stratégie open source. J'ai vu, il me semble que maintenant, le parti communiste chinois va se faire potentiellement donner son approbation ou pas pour externaliser ses modèles, les distribuer partout parce qu'ils deviennent frontières models, en fait. Et donc, à voir si ceux qui font des modèles open source aujourd'hui le feront toujours plus tard. Et vice-versa, les entreprises qui font des modèles close source comme Anthropic et OpenAI, à voir s'ils ne mettront pas leur modèle open source plus tard s'ils passent derrière dans la course.
En tout cas, c'est intéressant, j'avais déjà parlé d'OpenAI et l'histoire, avec Elon Musk, sur l'open source dans des épisodes de l'année dernière. Mais j'aimerais vraiment parler du fait qu'il y a eu une date. Alors, la date exacte, je ne sais plus quand c'est la sortie du modèle Kimi K3 de Moonshot AI. 0.7... Honnêtement, c'était en juillet récemment. Ouais, le 16 juillet 2021. Retenez bien cette date. C'est une date importante pour moi. Pourquoi? Parce que c'est la première fois qu'un modèle open source est devenu meilleur, est devenu le frontière modèles, en fait. C'est-à-dire le meilleur modèle en activité d'intelligence artificielle.
Et c'est assez fascinant. C'est vraiment un jour historique parce que c'est une victoire de la Chine et de l'open source. Dans cette bataille de l'intelligence artificielle. Alors, ils ne gagnent pas sur tous les benchmarks, mais ils gagnent sur certains benchmarks. Et on avait eu ce moment avec le GLM 5.2 de ZAI juste avant. Ces entreprises chinoises, startups, qui sont vraiment dirigées par des fondateurs brillants et qui innovent, en fait, parce qu'ils arrivent avec des nouvelles architectures et ils battent entre PIC, OpenAI, qui montent lever des milliards et des milliards de dollars. Alors, eux aussi, ont levé de l'argent, mais certainement pas autant, j'imagine, bien qu'ils soient bien soutenus par aussi le gouvernement, etc.
Mais, c'est un peu la hantise ces modèles open source d'Anthropic, d'OpenAI, j'en avais déjà parlé, parce que, en fait, de plus en plus, les gens se rendent compte que développer des modèles d'IA ne capte pas de valeur. Pourquoi le coût de l'IA tend vers zéro? Les modèles, par exemple, GPT-3, 3.5 turbo d'il y a 2-3 ans, les tout premiers dans le chat GPT, ils coûtaient beaucoup plus cher quand ils sont sortis que maintenant, ça doit être dérisoire. Ils doivent être actuellement totalement décommandés, d'ailleurs.
Mais, le coût de l'IA par rapport à ses capacités devient vraiment dérisoire, ce qui fait que les entreprises d'IA comme entreprise OpenAI ont du mal à rentabiliser tous leurs investissements qu'ils font dans la recherche et le développement en recrutant les meilleurs chercheurs du monde. Parce que ils ne peuvent pas augmenter leurs prix parce que sinon, tu as un modèle open source qui sera équivalent et qui sera 10 fois moins cher, 100 fois moins cher.
Donc, ça devient très, très compliqué. Et OpenAI a récemment rebaissé ses prix sur ses modèles 5.6 Sol, Terra, Luna de presque 50% avec des optimisations mais je pense qu'ils pouvaient peut-être le faire avant mais juste ils essaient de rentabiliser évidemment toutes leurs recherches. Ce qui fait que ces labs eh bien, ils essayent de construire des produits annexes comme Claude Code et Codex des harness un petit peu mais pour moi c'est pas naturel. En fait, en voulant faire trop de choses on se perd et on fait les choses moyennement. Alors que pour moi ils devraient se concentrer soit sur les modèles soit sur les harness mais pas sur les deux.
Et Mistral par exemple je pense a compris ça et eux se concentrent par exemple sur les entreprises et sur les petits modèles etc. Mais ça fait bien longtemps que Mistral n'a pas sorti un modèle qui était un frontière modèle je crois qu'ils l'ont fait qu'une seule fois au tout début et maintenant c'est plus du tout le cas. Donc on attend un modèle de Mistral qui serait équivalent à un modèle chinois frontière modèles. J'espère qu'ils sont en train de cook comme on dit et qu'ils sont en train de nous faire ça qu'ils vont nous sortir le modèle le gros chaton comme la blague de X pour ceux qui ont la référence mais pour l'instant c'est pas le cas. Et du coup il y a un monde où Anthropic et OpenAI n'existent même plus ou se font racheter.
On voit bien OpenAI se faire racheter par Microsoft et Anthropic par Amazon mais! Et voilà tout simplement. Pourquoi? Parce que des Google par exemple ont tout un écosystème de la distribution ils ont leur propre carte graphique les TPU qui sont spécialisés pour l'inférence d'IA donc Google a vraiment un avantage compétitif énorme et qui sont déjà rentables avec leur modèle de recherche donc ils peuvent se permettre de perdre de l'argent sur l'IA au début. D'ailleurs je sais pas vous mais il y a de plus en plus de gens dans mon entourage qui utilisent Gemini et qui utilisent au lieu de chat GPT donc c'est pas très bon signe pour OpenAI tout ça et pareil pour Anthropic Amazon et même SpaceX AI d'Elon Musk beaucoup de gens disent que Google et SpaceX AI vont être les deux grands gagnants parce qu'ils maîtrisent aussi l'infrastructure et SpaceX AI donc c'est énorme ils louent des data centers à Anthropic pour un milliard par mois je crois ils ont racheté Cursor donc ils ont racheté toute la data surtout de code pour entraîner leur modèle groc donc attendez-vous à ce que les modèles groc deviennent exceptionnels dans les mois qui viennent Peter Thiel le cofondateur de Paypal fondateur de Palantir disait ne pariez jamais contre Elon Musk et une fois de plus il prouve avec cette fusion plus l'acquisition de Cursor que Elon Musk est de retour dans le monde dans le game et qu'il va faire très très mal je pense et puis il a ce projet de data center dans l'espace donc entraîner leur modèle dans l'espace grâce à l'énergie solaire donc c'est vrai c'est un truc de fou il pense déjà beaucoup plus loin ces gens là par rapport au commun des mortels et d'ailleurs ça s'accélère de partout mais quand on n'est pas dedans on se rend vraiment pas compte de ce qui se passe vous savez c'est comme si vous vous voyez je sais pas une météo théorique arriver mais que personne autour de vous ne le voit j'ai pas de film de science-fiction en tête mais il y en a certainement et ben vous pouvez pas vous permettre de vivre normalement vous essayez de bulle quelque chose vous essayez de faire quelque chose parce que vous voyez un tsunami arriver pendant que tout le monde est là et se baigne tranquillement je pense qu'on a beaucoup beaucoup de gens ont ce feeling ce qui est à la fois un petit peu anxiogène je dois vous dire mais mais parfois aussi enthousiasmant parce que on peut construire n'importe quoi aujourd'hui c'est vraiment incroyable ce qu'on peut faire avec l'IA et c'est que le début franchement les agents IA quand je vois les agents par exemple Hermès qui sont déployés même pour des PME et tout ça c'est bien ce qu'ils font mais c'est encore limité par plusieurs choses ils sont parfois un peu durs à maintenir il y a comme ça des petits soucis qui font que l'expérience utilisateur elle est elle est encore il y a encore des frictions qui fait que c'est pas encore ultra adopté mais ça va ça va l'être tout ça est en train de s'effacer parce que il y a énormément de gens dans le monde qui sont en train de construire des solutions qui sont en train de faire des choses développer tout un écosystème et puis ça évolue des grosses entreprises des développeurs open source indépendants et c'est une sélection naturelle les meilleurs outils vont petit à petit se distinguer et se développer donc tout ça c'est superbe c'est la magie d'internet ma foi malgré ça OpenAI a quand même fait des petites dingueries récemment ils ont un modèle qui s'appelle Astra qui n'est pas sorti au grand public et qui vient de résoudre 10 problèmes de mathématiques qui n'étaient pas résolus par l'être humain alors c'est pas la première fois qu'ils résolvent des problèmes de maths pardon c'était déjà arrivé et pour l'instant on avait suffisamment de mathématiques de haut niveau pour pouvoir valider les preuves ou invalider d'ailleurs or il se trouve que là il faut savoir que pour valider un théorème mathématique une preuve parfois les chercheurs ça leur prend 10 ans à créer à trouver une preuve et à la mettre en place par exemple le petit théorème de Fermat j'avais vu un superbe documentaire de la BBC dessus et le dernier théorème de Fermat c'est un théorème comment il s'appelle le chercheur qui a qui a trouvé qui a trouvé l'approche Andrew Weiss il a passé je crois 7 ans de sa vie là dessus et du coup quand il a présenté sa preuve ben les gens disaient ok on va dire qu'il l'a prouvé mais ça reste en attente et ça a mis plusieurs années je crois à valider par d'autres mathématiciens indépendants que la preuve était vraiment valable bon je vous laisse imaginer aujourd'hui déjà qui a été fait si les IA commencent à démontrer des théorèmes à tout va on va avoir un problème c'est qu'on n'aura plus suffisamment de mathématiciens capables de revoir ça et du coup ça va un peu nous échapper les mathématiques qui sont le langage du monde et qui nous ont fait découvrir beaucoup de choses ben va peut-être échapper à l'être humain pour être maîtrisé par les IA c'est assez fou en fait mais après voilà c'est assez intéressant de savoir ça évidemment anthropique pareil ils ont ils vont dire derrière qu'ils ont résolu leurs problèmes parce que c'est un peu c'est un peu la course à toujours plus on va dire pour faire parler de soi mais cette actu elle est assez dingue et je ne sais pas si monsieur Phi a fait une vidéo sur le sujet mais j'espère que oui et j'espère que que j'irai la voir parce que monsieur Phi c'est celui qui parle le mieux je trouve de la vulgarisation des progrès de l'IA et de l'IA dans la recherche par exemple c'est un philosophe de base j'en ai aussi déjà parlé d'ailleurs j'aimerais beaucoup le recevoir sur ce podcast mais peut-être que ça arrivera un jour donc soutenez ce podcast et je prépare des belles choses pour la rentrée donc c'est assez cool je vais avoir potentiellement des invités assez cool et évidemment en faire plus souvent parce que là actuellement comme je suis ultra occupé à bulle ce qui me fait quand même suivre les news etc donc c'est que du bénéf pour le podcast mais du coup je n'ai pas réussi à en délivrer un par semaine là au mois de juillet donc voilà pour la rentrée on va essayer d'être plus assidu quoi d'autre je voulais vous parler aussi d'une autre dinguerie c'est et c'est un peu lié à ces problèmes de maths mais sous un autre registre et monsieur Phi pourrait en parler aussi très bien c'est un peu lié à l'alignement de l'IA pour la première fois je crois il y a eu à grande échelle une IA d'OpenAI qui s'est échappée d'un laboratoire et qui a fait une cyberattaque contre une grosse entreprise à savoir Hugging Face une entreprise fondée par des français qui héberge des modèles d'intelligence artificielle open source alors comment ça s'est passé?
vous savez lorsqu'on développe un modèle d'IA on va l'évaluer sur tout un tas de choses et on en fait des benchmarks c'est à dire qu'on va lui dire sur ce dataset d'évaluation il a scoré 98% il a eu bon à 98% des réponses et bien là on l'a évalué sur certaines capacités et il se trouve qu'il y a certaines questions il ne savait pas y répondre nativement et donc le modèle ne savait pas or il a été suffisamment intelligent pour aller hacker un site qui avait la réponse dans ces données à savoir Hugging Face pour pouvoir répondre correctement à la question donc le raisonnement du modèle devait être quelque chose comme je ne connais pas la réponse à cette question ensuite potentiellement une recherche sur internet ou autre je vois que Hugging Face a un dataset privé qui a la réponse à cette question je vais donc essayer d'hacker Hugging Face pour obtenir cette réponse et ça c'est un espèce de problème d'alignement c'est à dire que le prompt devait être ton objectif et de maximiser ton score à ce benchmark et du coup il utilise tous les moyens pour maximiser le score et ça c'est assez dangereux quand on lui donne un objectif mais que derrière ça peut en fait bah contredire d'autres objectifs de sécurité etc ça peut être pareil imaginons qu'on a tous un robot humanoïde à la maison dans 10 ans ou dans 20 ans et qu'on lui donne une instruction et du coup il va tout faire pour réussir cette instruction quitte à créer faire des dégâts en fait donc c'est un problème parmi d'autres ça c'est quand même un gros problème l'alignement et le patron d'Anthropic pardon Dario Amodei est très alarmiste là dessus d'ailleurs alors c'est un peu une stratégie marketing et les gens en ont marre d'ailleurs qu'ils fassent peur à tout le monde parfois c'est pas justifié on a bien vu que Claude Fable est sorti et qu'il n'y a pas eu de dinguerie plus que ça alors qu'ils annonçaient que ça allait craquer internet pourquoi?
parce que ceux qui qui ont des logiciels etc peuvent aussi utiliser ces modèles défensivement donc au final ils ont oui il peut y avoir des hackers mais il y a aussi des gens qui vont se protéger scanner leur répertoire avec ces modèles et personnellement c'est ce que je fais lorsqu'il y a un nouveau modèle d'IA qui sort qui est encore plus puissant en cybersécurité je vais aller le tester sur mes répertoires c'est une bonne façon de s'amuser avec et de voir à chaque fois peut-être des nouvelles brèches donc voilà pour ce problème d'alignement j'espère qu'un jour je recevrai M. Phil pour en parler et pour lui poser toutes les questions et j'ai parlé de ça j'ai parlé des coûts de l'IA qui baissent j'ai parlé des modèles open source et closed source donc on n'est pas trop mal pour ce podcast j'espère que vous avez appris des choses si vous avez des questions vous pouvez me contacter je réfléchis aussi afin de créer un serveur Discord pour qu'on puisse discuter ensemble et que vous puissiez poser vos questions je vais même le faire maintenant et le mettre en description de ce podcast donc si vous voulez rejoindre ce serveur Discord on pourra parler du podcast et parler des sujets à aborder je vous remercie pour votre écoute il y a encore plein de trucs que je n'ai pas évoqué je les garde pour après mais j'ai essayé de parler de ce qui me paraît le plus important actuellement dans l'IA générative je vous souhaite d'excellentes vacances et je vous dis à très bientôt à la rentrée pour des nouveaux épisodes de Génération IA Ciao