Auteur : Stratechery
Traduction : TechFlow
Note de la rédaction TechFlow : Kimi K3 bouleverse le marché des modèles cognitifs, pourquoi Wall Street et la Silicon Valley réagissent-elles de manière excessive ? Cet article décompose comment, après l'entrée de l'IA de l'ère ChatGPT dans l'ère des Agents, les jetons (tokens) ne sont plus une marchandise, la véritable marchandise est l'intelligence elle-même — et dans cette guerre où le coût marginal est roi, les modèles open source chinois semblent gratuits, mais en réalité, le coût du service n'est pas du tout faible. La panique des laboratoires de pointe est davantage due au fait qu'ils ne se sont pas encore adaptés aux nouvelles règles du jeu, passant d'une domination par les coûts d'entraînement à une domination par l'échelle d'inférence.
J'ai déjà raconté une histoire sur mon premier jour au cours STRT-431 à la Kellogg School of Management, un cours obligatoire pour tous les nouveaux étudiants en MBA. J'ai parcouru les documents du cours et les études de cas, déçu de ne trouver aucune entreprise technologique dans le programme. Je suis allé voir le professeur pour demander pourquoi, et la réponse obtenue fut : l'objectif de ce cours n'est pas d'étudier des industries spécifiques, mais de découvrir des principes universels applicables à toute industrie et toute entreprise.
Comme je le dis souvent, j'étais très insatisfait de cette réponse à l'époque : à mon avis, la nature de la technologie, en particulier le coût marginal nul (et le coût de transaction nul) des logiciels et de la distribution, est fondamentalement différente. Remplir zéro dans une formule tend à tout bouleverser. Mais j'ai vite réalisé que c'était恰恰 ma opportunité. L'idée centrale de la Théorie de l'agrégation (Aggregation Theory) est : le coût marginal nul conduit à une chaîne de valeur complètement différente de ce que les gens attendaient autrefois d'Internet — dans un monde où contrôler la demande est plus important que distribuer l'offre, vous verrez de la centralisation et de la mise à l'échelle.
Cependant, ce qui est intéressant avec l'IA, c'est que ces anciens principes universels reviennent sur le devant de la scène. Cela s'est manifesté le plus clairement le week-end dernier, lorsque des débats intenses sur Kimi K3 ont éclaté sur X. Kimi K3 est un autre modèle à poids ouvert lancé par la Chine, dont les capacités se rapprochent de l'état de l'art. Pour faire court : le coût marginal est revenu d'une manière significative, que ce soit en termes d'impact à court terme des modèles gratuits de pointe ou de la structure à long terme de l'industrie.
COGS et dépenses de R&D
L'un des malentendus les plus courants concernant les modèles à poids ouverts est qu'ils sont moins chers — voire gratuits. Après tout, vous pouvez directement télécharger les poids, sautant ainsi le temps, les frais et les capacités nécessaires pour créer votre propre modèle. C'est当然 vrai, mais ici, "gratuit" fait référence au montant que vous devez dépenser en recherche et développement (R&D). La R&D est une dépense fixe, sans rapport avec les revenus que vous générez. Si vous avez dépensé 1 million de dollars en R&D, que vos revenus soient de 100 000 dollars ou de 100 millions de dollars, vous avez toujours dépensé 1 million de dollars en R&D (bien sûr, cela affecte votre rentabilité).
Ce qui est lié aux revenus, c'est le COGS — coût des ventes — et le COGS est bien réel pour l'IA, ce qui n'était pas le cas dans l'industrie logicielle depuis longtemps. Plus précisément, exécuter l'inférence sur un modèle — que ce soit Kimi ou Fable — coûte de l'argent, et l'argent que les fournisseurs d'IA dépensent en inférence, du moins dans la plupart des modèles commerciaux, est directement lié aux revenus. En reprenant l'exemple ci-dessus, générer 100 millions de dollars de revenus contre 100 000 dollars de revenus pourrait nécessiter 1000 fois plus de COGS. Plus précisément, si le coût des jetons pour générer 1 dollar de revenus est de 50 cents, alors 100 millions de dollars de revenus auront 50 millions de dollars de COGS, et 100 000 dollars de revenus seulement 50 000 dollars de COGS.
Le point clé concernant les modèles à poids ouverts est qu'ils ne sont pas des services gratuits. Le coût de Kimi K3 est de 3 dollars par million de jetons d'entrée et de 15 dollars par million de jetons de sortie. C'est moins cher que les 5 dollars par million de jetons d'entrée de Sol et les 30 dollars par million de jetons de sortie, mais ce n'est peut-être pas la bonne métrique.
Jetons vs Intelligence
Le PDG de NVIDIA, Jensen Huang, décrit ce que NVIDIA est en train de construire comme une "usine à jetons", ce qui est raisonnable du point de vue de NVIDIA. Les GPU de NVIDIA ne sont pas ciblés sur un modèle spécifique : ils génèrent des jetons, et le font de la manière la plus rapide et la plus efficace possible. Cela conduit à des métriques telles que les jetons par seconde, le temps jusqu'au premier jeton, les jetons par watt, le coût des jetons, etc., que Jensen Huang considère comme la base des décisions.
Ce cadre avait确实 du sens dans le premier paradigme de l'IA — l'ère de ChatGPT — où les jetons étaient directement livrés à l'utilisateur final. Cependant, le deuxième paradigme de l'IA, l'ère de l'inférence, a bouleversé cette méthode de mesure. L'inférence signifie une explosion des jetons de chaîne de pensée, et différents modèles nécessitent des quantités différentes de jetons d'inférence pour obtenir la bonne réponse. Par exemple, il est rapporté que Kimi utilise significativement plus de jetons que Sol, ce qui annule son avantage de prix. Les Agents introduisent une dynamique similaire : certains modèles sont plus efficaces en termes de nombre de jetons nécessaires pour exécuter les flux de travail des Agents.
Cela signifie que les jetons ne sont pas une marchandise. La caractéristique définissante d'une marchandise est qu'elle est interchangeable : un gallon de pétrole est un gallon de pétrole, une tonne de cuivre est une tonne de cuivre, un boisseau de blé est un boisseau de blé. Mais les jetons d'un modèle sont différents des jetons d'un autre modèle. Ce qui est interchangeable, c'est ce qui est construit avec les jetons, c'est-à-dire l'intelligence. En d'autres termes, si Kimi et Sol génèrent tous deux la bonne réponse, alors cette réponse est interchangeable. La différence dans le nombre de jetons nécessaires pour générer la bonne réponse entraînera une différence de COGS.
Le COGS de l'intelligence est une fonction de plusieurs facteurs différents :
Empreinte du modèle : les poids et l'état d'exécution déterminent combien de mémoire coûteuse et combien d'accélérateurs sont nécessaires pour héberger chaque copie du service
Efficacité de l'inférence : les choix d'architecture (comme les modèles à experts mixtes) réduisent la quantité de calcul par jeton généré
Efficacité mémoire : les choix d'architecture peuvent réduire les besoins en cache KV, permettant plus de requêtes concurrentes et une meilleure utilisation des GPU
Efficacité du service : le batch processing, l'ordonnancement, le cache de préfixe et autres optimisations d'inférence maximisent l'utilisation et partagent le travail entre les requêtes
Efficacité des jetons : moins il faut de jetons pour atteindre la bonne réponse, plus le coût d'inférence est bas
Ceci est important car nous nous approchons rapidement d'un état où, pour de nombreuses tâches économiquement bénéfiques, l'intelligence est effectivement une marchandise. Par exemple, toute personne construisant des applications CRUD de base pourrait utiliser des modèles de plusieurs fournisseurs pour les compléter. Et sur un marché de produits de base, la voie vers la rentabilité ne passe pas par la facturation de prix plus élevés — vous pouvez (ou pourrez bientôt) utiliser plusieurs modèles pour créer exactement la même application — mais par la possession d'une structure de coûts supérieure.
Comprendre le marché des produits de base
Il vaut la peine de démêler les mécanismes ici, car comme je l'ai souligné il y a quelques mois dans "La durabilité d'Amazon", la dynamique des marchés de produits de base n'est pas familière aux professionnels de l'industrie technologique :
Sur un marché de produits de base, tout le monde facture le même prix, car tout le monde vend la même chose. Ce prix est déterminé par l'offre et la demande
La demande de produits de base est une fonction de l'élasticité-prix : plus le produit de base est bon marché, plus la demande est grande, et vice versa
L'offre de produits de base est une fonction du coût marginal de production du produit de base
La clé à comprendre est que le coût marginal de production du produit de base diffère selon les fournisseurs. En pratique, cela signifie que les fournisseurs ayant la structure de coûts la plus mauvaise finissent par vendre le produit de base à leur coût marginal (s'ils peuvent encore produire). Le profit de tous les autres dépend de la mesure dans laquelle leur structure de coûts est meilleure que celle du fournisseur marginal.
Un exemple :
Le fournisseur A peut produire 10 unités de produit de base à un coût de 10 dollars par unité
Le fournisseur B peut produire 10 unités de produit de base à un coût de 15 dollars par unité
Le fournisseur C peut produire 10 unités de produit de base à un coût de 20 dollars par unité
Supposons que l'élasticité-prix crée une demande de 25 unités de produit de base à 20 dollars. Cela signifie :
Le fournisseur A vendra 10 unités à 20 dollars, gagnant 10 dollars par unité
Le fournisseur B vendra 10 unités à 20 dollars, gagnant 5 dollars par unité
Le fournisseur C vendra 5 unités à 20 dollars, gagnant 0 dollar par unité
Ce n'est pas tout à fait exact : la raison pour laquelle le fournisseur C assume la pénurie est que les fournisseurs A et B sont capables de sous-enchérir légèrement leurs prix, ce qui affectera bien sûr la demande (élastique), mais cela illustre le problème. Le fournisseur A a une bonne affaire, le fournisseur B a une affaire correcte, le fournisseur C est en faillite.
Le risque de faillite est l'endroit où les coûts fixes reviennent sur le devant de la scène : le fournisseur C a à la fois des coûts fixes (comme les dépenses de R&D possibles) et peut avoir contracté des dettes pour financer l'équipement nécessaire à la production du produit de base. Il ne peut pas fixer le prix du produit de base sur la base de ces coûts — rappelez-vous, le prix d'équilibre du marché est proche du coût marginal de l'unité de coût la plus élevée nécessaire pour satisfaire la demande — mais ces coûts peuvent absolument pousser le fournisseur hors du marché. Si le fournisseur fait faillite, les prix augmenteront jusqu'à ce qu'un autre fournisseur décide d'entrer (ou que d'autres fournisseurs se développent).
Le marché de l'intelligence
Revenons aux modèles. Pour l'instant, toute l'analyse ci-dessus ne s'applique pas, car la demande pour les modèles de pointe dépasse l'offre, et l'offre est limitée par le manque de puissance de calcul. Cette pénurie de puissance de calcul signifie non seulement que les fournisseurs de puissance de calcul comme NVIDIA peuvent obtenir des marges bénéficiaires très élevées, mais aussi que les clients de NVIDIA, comme SpaceXAI, peuvent également revendre la puissance de calcul avec des marges élevées à des entreprises comme Anthropic. Pendant ce temps, Anthropic peut payer la majoration, car ils peuvent vendre des jetons avec une majoration plus élevée.
Cependant, ce n'est pas seulement la demande excédentaire qui donne à Anthropic d'énormes marges : Anthropic et OpenAI peuvent avoir le coût unitaire le plus bas pour l'intelligence de qualité de pointe, grâce aux capacités des modèles, à l'échelle du service et à l'efficacité des jetons. Ils desservent des modèles de niveaux de capacité spécifiques plusieurs mois avant leurs concurrents, tout en appliquant les meilleurs modèles pour optimiser ces coûts.
Il est également notable que le marché ne considère pas encore l'intelligence comme une marchandise : la demande est spécifiquement dirigée vers Anthropic et OpenAI, et la demande pour des modèles moins bons est beaucoup plus faible (c'est pourquoi SpaceXAI et Meta vendent leur capacité à Anthropic). Une façon de penser à la poussée vers l'optimisation des coûts est que c'est une fonction définissant le travail à faire par niveau d'intelligence, de sorte que les acheteurs d'intelligence peuvent créer un marché où l'intelligence est commoditisée. Cependant, à long terme, whoever est à la pointe est le plus capable de dominer les marchés non de pointe, qui ne sont que la pointe moins n mois, c'est-à-dire les mois pendant lesquels les fabricants de modèles de pointe ont optimisé leurs coûts de service.
Tout cela pour dire que je pense que la réaction générale à Kimi et aux modèles chinois est assez excessive, du moins d'un point de vue économique. Il y a maintenant un parapluie de prix, qui est le résultat en aval du manque de puissance de calcul. Je doute fort que les modèles chinois soient moins chers à servir sur la base du coût marginal, ils semblent simplement moins chers parce que l'offre d'Anthropic et d'OpenAI est si limitée qu'ils facturent des prix bien supérieurs à ce qu'ils seraient s'il y avait suffisamment d'offre pour satisfaire la demande d'intelligence.
La panique des laboratoires de pointe
Alors, pourquoi les fabricants de modèles semblent-ils si paniqués par les modèles chinois ?
Premièrement, je pense que les laboratoires de pointe sont ancrés dans un monde où les coûts d'entraînement dominent leur modélisation financière. Tant que l'entraînement consomme plus de GPU que l'inférence, maximiser les revenus d'inférence pour aider à financer la prochaine session d'entraînement est crucial, ce qui signifie facturer des prix très élevés pour l'inférence.
Cependant, looking forward, je m'attends à ce que le marché de l'inférence croisse beaucoup plus rapidement que les coûts d'entraînement (ce qui inclut l'hypothèse que les coûts d'entraînement continueront de grimper en flèche), ce qui signifie qu'ils peuvent vraiment compenser par le volume. Il y a encore huit mois, il n'était pas clair si cela deviendrait réalité, mais le déblocage du paradigme des Agents est si énorme que les laboratoires de pointe devraient avoir plus confiance qu'ils peuvent non seulement survivre avec des prix plus bas, mais aussi prospérer (une fois qu'ils ont suffisamment de puissance de calcul).
Deuxièmement, l'intelligence n'est en fait pas une marchandise parfaite, en partie parce que l'application de l'intelligence la rend plus intelligente. Plus précisément, whoever exécute l'inférence collecte également des données, et ces données seront utilisées pour rendre le modèle de l'itération suivante meilleur. D'une part, c'est une raison de plus pour que les laboratoires de pointe baissent les prix et augmentent l'utilisation lorsque plus de puissance de calcul est en ligne. D'autre part, c'est pourquoi des entreprises comme Microsoft sont de plus en plus obsédées par l'aide aux entreprises pour exécuter leurs propres modèles. Si les modèles chinois sont une alternative viable, cela devient encore plus faisable.
Troisièmement, une autre façon pour les laboratoires de pointe de se différencier des modèles chinois, et les uns des autres, est de continuer à s'intégrer vers le haut dans l'expérience client. Claude Code et Codex se sont avérés assez collants, ce qui est choquant. Quel que soit l'outil avec lequel vous commencez, c'est probablement celui que vous continuerez à utiliser, surtout pour les utilisateurs non techniques. À long terme, cette nécessité de se déplacer vers le haut signifie vraiment que les modèles de pointe sont absolument une menace pour les fournisseurs de logiciels, y compris Microsoft. D'un autre côté, dans la mesure où les entreprises logicielles possédant actuellement l'expérience client peuvent obtenir des modèles compétitifs, elles peuvent résister à l'érosion des laboratoires de pointe.
Enfin, l'angle idéologique d'Anthropic ne doit pas être particulièrement négligé. C'est une entreprise qui croit que seule elle peut être confiée à l'IA, et l'existence d'alternatives à poids ouverts est un coup fatal à cette hypothèse.
Les motivations de la Chine
Kimi n'est pas le seul nouveau modèle chinois. Bloomberg rapporte :
Le cours de l'action d'Alibaba Group Holding Limited a augmenté de 5,4 % lundi, après que l'entreprise a lancé une version aperçu de son modèle phare Qwen3.8 Max, affirmant qu'il est仅次于 Fable 5 d'Anthropic. Cette lancement dimanche a eu lieu seulement quelques jours après que la startup Moonshot AI a lancé un nouveau produit puissant, qui a secoué le marché et provoqué des inquiétudes aux États-Unis concernant le rapprochement de la Chine avec des leaders mondiaux comme Anthropic et OpenAI. Qwen3.8 Max possède 2,4 billions de paramètres, entrant dans la catégorie des poids lourds avec le Kimi K3 de Moonshot AI. K3 possède 2,8 billions de paramètres, comparable aux produits de pointe, et Alibaba a également fixé des attentes tout aussi élevées.
Les développeurs peuvent maintenant accéder à Qwen3.8 Max via la plateforme de codage d'Alibaba (y compris Qoder). Alibaba prévoit d'ouvrir bientôt les poids de ce modèle, étendant l'accès au-delà de la version aperçu. L'intérêt pour ces systèmes et modèles d'intelligence artificielle fabriqués en Chine est si élevé que Moonshot a été contraint de suspendre l'acceptation de nouveaux abonnements dimanche soir pour faire face à une demande écrasante.
Le cours de l'action d'Alibaba Group Holding Limited a augmenté de 5,4 % lundi à un moment donné, après que l'entreprise a lancé une version aperçu de son modèle phare Qwen3.8 Max, et a affirmé qu'il est仅次于 Fable 5 d'Anthropic PBC. Cette lancement dimanche a eu lieu seulement quelques jours après que Moonshot AI a lancé un nouveau produit puissant, qui a secoué le marché et provoqué des inquiétudes aux États-Unis concernant le rapprochement de la Chine avec des leaders mondiaux comme Anthropic et OpenAI. Qwen3.8 Max possède 2,4 billions de paramètres, entrant dans la catégorie des poids lourds avec le Kimi K3 de Moonshot. K3 possède 2,8 billions de paramètres, comparable aux produits de pointe, et Alibaba a également fixé des attentes tout aussi élevées.
Les développeurs peuvent maintenant accéder à Qwen3.8 Max via la plateforme de codage d'Alibaba, y compris Qoder. Alibaba prévoit d'ouvrir bientôt les poids de ce modèle, étendant l'accès au-delà de la version aperçu. La demande pour ces systèmes et modèles d'intelligence artificielle fabriqués en Chine est si élevée que Moonshot a été contraint de suspendre l'acceptation de nouveaux abonnements dimanche soir pour faire face à une demande écrasante.
Le fait que Qwen3.8 Max ouvrira également les poids est notable. Alibaba a arrêté de publier les poids de ses modèles leaders plus tôt cette année, mais semble avoir changé cette décision ; je soupçonne que ce changement est lié au discours de Xi Jinping sur l'IA la semaine dernière, qui a doublé la mise sur une approche de poids ouverts :
Nous devons adhérer au principe de l'ouverture et du gain mutuel, et promouvoir le développement piloté par l'innovation. En tant que nouveau moteur de la croissance économique mondiale et accélérateur de la transformation de la dynamique de croissance, l'intelligence artificielle passe du monde numérique au monde physique. Nous devons saisir cette opportunité historique rare, encourager l'open source, l'ouverture, la collaboration et le partage. Nous devons promouvoir l'innovation technologique, le développement industriel et l'application scénarisée de l'intelligence artificielle. Nous devons coordonner la promotion de la transformation et de la mise à niveau des industries traditionnelles, la culture et le renforcement des industries émergentes, et la planification prospective des industries futures, afin que toutes les industries puissent bénéficier de l'intelligence artificielle.
La stratégie de la Chine est évidente : commoditisez vos compléments. Notez que Xi Jinping lie explicitement l'ouverture à l'IA "passant du monde numérique au monde physique" ; le monde physique est un monde dominé par la Chine, et le leadership de la Chine dans des domaines comme la robotique bénéficiera énormément de modèles d'IA largement disponibles.
De même, la Chine ne veut pas que les États-Unis obtiennent un avantage asymétrique en matière d'IA ; si la Chine peut affaiblir les laboratoires de pointe américains tout en renforçant tous les opposants américains potentiels, c'est encore mieux, et elle peut bénéficier de l'innovation attachée à un écosystème ouvert.
Le problème de la distillation
De même, ne vous attendez pas à ce que la Chine prenne des mesures contre les attaques de distillation des laboratoires de pointe. Je pense qu'il est erroné d'attribuer tout le succès des laboratoires chinois à la distillation, mais il est tout aussi faux de prétendre que la distillation n'a pas donné un énorme avantage aux laboratoires chinois. Cet avantage s'est vraiment manifesté au cours de la dernière année, car l'apprentissage par renforcement post-entraînement est devenu de plus en plus important pour les performances des modèles. Les laboratoires chinois n'ont pas besoin de construire un environnement d'apprentissage par renforcement à partir de zéro, mais peuvent simplement utiliser les modèles des laboratoires de pointe comme enseignants, réalisant des améliorations rapides à un coût beaucoup plus faible (ce n'est pas la seule raison pour laquelle les coûts de développement des modèles chinois sont plus bas, mais c'est une raison importante).
Il est intéressant de noter que l'un des cas d'usage les plus importants des modèles chinois en Occident est la distillation elle-même. Par exemple, Thinking Machines, qui vient de publier un modèle à poids ouvert, s'appuie sur des modèles chinois pour résoudre le problème de démarrage à froid de l'apprentissage par renforcement. Dean Meyer et Konstantine Buhler ont écrit un excellent article sur X, expliquant que la distillation place les modèles à poids ouverts occidentaux dans un désavantage fondamental par rapport à la Chine :
La distillation n'explique pas tout l'avance de la Chine en matière de modèles ouverts. Les laboratoires chinois disposent de chercheurs de classe mondiale, d'énormes quantités de puissance de calcul, de puissants modèles de pré-entraînement, d'une conception协同 des logiciels et du matériel, et de capacités post-entraînement en rapide amélioration. Mais la distillation compresse le dernier écart coûteux entre une base puissante et des systèmes proches de la pointe. Même si la part de la distillation dans la capacité totale des modèles chinois est faible, elle représente une part importante de leur avantage par rapport aux modèles ouverts américains.
Les nouveaux mécanismes d'application rendront la distillation à grande échelle plus difficile, plus lente et plus coûteuse pour les entreprises chinoises. Cependant, l'application ne peut pas éliminer la distillation soutenue par des acteurs étatiques. Ainsi, chaque progrès de pointe en Occident crée un autre enseignant pour les laboratoires chinois. Les constructeurs occidentaux doivent soit reproduire indépendamment ces capacités, soit attendre d'apprendre des modèles chinois. Cet écart fournit aux laboratoires chinois un avantage structurel récurrent par rapport aux entreprises occidentales.
Ce point mérite d'être répété : parce que les fabricants de modèles à poids ouverts américains doivent respecter les conditions de service des laboratoires de pointe, ils (1) sont inférieurs aux alternatives chinoises, (2) finissent par distiller des distillats, faisant simplement un détour par les laboratoires chinois. Ne serait-il pas mieux que les fabricants de modèles à poids ouverts occidentaux puissent accéder directement à la source ?
Pour cela, il y a une question encore plus intéressante autour de la distillation : pourquoi est-ce exactement mauvais ? Après tout, les grands modèles de langage ne sont-ils pas une distillation de toutes les connaissances sur l'Internet ouvert, scrapées et distillées par les laboratoires de pointe dans les modèles en cours de distillation ? Qui est lésé ici exactement ?
En fait, ce paradoxe est la solution. Je crois que les modèles à poids ouverts sont bénéfiques pour l'innovation (et, selon ce qui précède, je pense que les laboratoires de pointe s'en sortiront bien), mais dépendre de la Chine est un problème. Les États-Unis devraient adopter une loi, (1) stipulant clairement que la collecte de données pour l'entraînement de modèles constitue un usage loyal, (2) interdisant au moins aux entreprises américaines les conditions de service interdisant la distillation. Empêcher la distillation — en fait, interroger l'API — est presque impossible ; les États-Unis devraient prendre l'autre voie, penchant vers une nouvelle politique de droit d'auteur qui protège les laboratoires, tout en garantissant que les connaissances qu'ils ont acquises alimentent l'innovation future pour les autres.
Raisons de s'inquiéter
Tout l'article a été consacré à dissiper la réaction excessive à Kimi K3 et aux modèles à poids ouverts chinois ; cependant, il y a une raison de s'inquiéter, c'est la cybersécurité. Considérez cette histoire de The Stack :
Hugging Face a indiqué que son infrastructure de production a été compromise la semaine dernière par un système d'agent IA "autonome". L'équipe de sécurité de la plateforme a été initialement entravée dans la réponse aux incidents (IR) par les garde-fous de modèles de pointe LLM américains non nommés, "qui ne pouvaient pas distinguer les répondants aux incidents des attaquants", ont-ils dit. Par conséquent, les défenseurs de Hugging Face se sont tournés vers le modèle open source GLM 5.2 du laboratoire chinois Z.ai — l'exécutant sur leur propre infrastructure pour analyser les plus de 17 000 journaux ou empreintes laissés par les attaquants.
Pour Hugging Face, basée à New York, c'est une admission publique remarquable, l'entreprise qui permet aux utilisateurs de collaborer sur des modèles, des ensembles de données et des applications, ayant atteint un jalon de 100 millions de dollars d'ARR cet été. Dans un rapport d'incident, l'entreprise a conseillé aux défenseurs de "préparer avant un incident un modèle capable qui peut fonctionner sur votre propre infrastructure [notre italique], à la fois pour éviter le verrouillage des garde-fous et pour empêcher les données et les identifiants des attaquants de quitter votre environnement."
Il est difficile d'exagérer à quel point la réaction de panique de l'administration Trump à la publication de Fable par Anthropic était erronée, surtout parce qu'elle a exacerbé les pires tendances d'Anthropic, à savoir supposer que seuls eux peuvent être fiables pour utiliser une IA puissante. Dans un monde avec une seule IA, il pourrait être raisonnable de réserver les capacités de cybersécurité les plus puissantes au gouvernement américain et aux alliés de confiance ; cependant, ce n'est pas le monde dans lequel nous vivons.
Il y a déjà et il y aura des modèles parfaitement capables de lancer des attaques de cybersécurité sur l'infrastructure existante, et ces modèles seront — sont déjà — largement disponibles. La meilleure défense — en fait, la seule défense viable — sera de s'assurer que les défenseurs ont également accès aux meilleurs modèles. Maintenant, en raison des directives de l'administration Trump, les défenseurs sont effectivement interdits d'utiliser Fable ou Sol pour la cybersécurité ; cela signifie que la meilleure alternative est d'utiliser des modèles d'un pays qui a essayé d'affaiblir nos défenses de cybersécurité pendant des années. C'est fou !
La meilleure approche est claire : premièrement, assouplir les restrictions sur Fable et Sol en matière de cybersécurité, deuxièmement, s'assurer que les fabricants de modèles à poids ouverts américains sont sur un pied d'égalité avec la Chine. Oui, les laboratoires de pointe vont beaucoup protester, mais le gouvernement devrait réaliser que écouter leur hystérie a déjà conduit les États-Unis à une situation où les entreprises américaines dépendent de la Chine pour la défense. Laissez les laboratoires de pointe gagner en faisant mieux ; ne les laissez pas définir la sécurité ou la sûreté, et ne les laissez pas tirer l'échelle de la connaissance collective humaine. La Chine est déjà assez difficile à concurrencer ; leur laisser porter le drapeau de l'ouverture et de l'innovation revient tout simplement à abandonner notre plus grand avantage.











