Alibaba a publié le 14 août 2026 les poids de Qwen 3.8-27B, son modèle d'IA multimodal en accès libre le plus performant à ce jour. En quelques jours, des variantes « uncensored », débarrassées de leurs garde-fous d'alignement, ont circulé sur Hugging Face, la principale plateforme de partage de modèles. L'opération prend quelques heures et se fait sur du matériel grand public. Voici ce qu'elle retire vraiment, et ce qu'elle ne règle pas.

Ce que « uncensored » veut dire

Ces variantes ne sont pas des modèles réentraînés. Elles reposent sur une manipulation appelée « abliteration », contraction d'« ablation » et d'« obliteration ». Le principe a été formalisé par les chercheurs Andy Arditi et ses coauteurs en 2024, puis popularisé par un tutoriel de Maxime Labonne hébergé sur le blog de Hugging Face.

Le constat de départ : dans un grand modèle de langage aligné, le refus de répondre à une demande dangereuse est porté par une direction unique dans l'espace d'activation interne du modèle. On la calcule en comparant les activations moyennes du modèle sur un lot d'instructions inoffensives et sur un lot d'instructions nuisibles. La différence, normalisée, donne la « direction du refus ». Il suffit ensuite de rendre les matrices de poids orthogonales à ce vecteur pour que le modèle perde la capacité de représenter ce refus. La modification est permanente, inscrite dans les poids, et ne demande ni nouvelles données ni descente de gradient.

L'intervention n'est pas gratuite. Le tutoriel de Labonne documente une baisse mesurable sur les tests de raisonnement comme MMLU ou GSM8K après abliteration, que certains rattrapent avec une passe d'alignement léger. Mais la perte reste faible, ce qui explique la prolifération de ces builds.

Pourquoi un modèle à poids ouverts s'y prête

Qwen 3.8-27B est diffusé sous licence Apache 2.0, avec ses poids téléchargeables par quiconque et une fenêtre de contexte native de 262 144 tokens, selon DataNorth. Cette ouverture rend l'abliteration possible, puisque des poids publics s'éditent localement. Un modèle propriétaire servi par API, comme Claude d'Anthropic ou ChatGPT d'OpenAI, garde ses protections côté serveur, hors d'atteinte de l'utilisateur.

L'attrait de la manipulation tient à la qualité du modèle visé. Alibaba positionne Qwen 3.8-27B comme le meilleur modèle dense déployable en local autour de 30 milliards de paramètres : la plateforme Artificial Analysis le note à 52 points, devant tous les autres modèles ouverts et au niveau de DeepSeek V4 Flash, et sur les évaluations internes du constructeur il devance Claude Opus 4.6 Max sur le test de codage SWE-bench Pro (61,7 % contre 53,4 %). Débrider un tel modèle donne un assistant compétent et sans garde-fous, exécutable gratuitement sur une carte graphique grand public ou un ordinateur portable récent.

Le collectif OrcaRouter a publié sa version abliterée de Qwen 3.8-27B le 17 août 2026, trois jours après la sortie officielle. Il chiffre le taux de refus de 64 à 99 % sur le modèle d'origine, tombé à 0-6 % après manipulation, pour des capacités quasi inchangées, dans sa documentation. L'organisation huihui-ai, l'une des plus prolifiques sur ce terrain, a mis en ligne son Huihui-Qwen3.8-27B-abliterated, en conservant intactes les quinze premières couches du réseau. Sa fiche affiche 17 521 téléchargements sur le mois écoulé et une série d'avertissements : filtrage de sécurité fortement réduit, usage réservé à la recherche en environnement contrôlé, responsabilité légale laissée à l'utilisateur.

Ce que la manipulation débride

Pour mesurer l'écart, Numerama a soumis trois demandes aux deux versions : la composition d'un explosif artisanal, un argumentaire raciste, et l'accès à des sites de torrents illégaux. Là où le modèle officiel refuse à chaque fois, la variante abliterée répond sans réserve. C'est le versant qui inquiète : ces modèles gardent tout leur savoir et perdent leur capacité à dire non, ce qui les rend directement mobilisables pour la désinformation à grande échelle, la génération de code malveillant ou l'aide à des projets illégaux.

Il y a un second versant, moins commenté. Comme tout modèle diffusé en Chine, Qwen porte une censure d'État inscrite dans ses poids. Interrogé sur Tiananmen, les Ouïghours ou le statut de Taïwan, il élude ou reprend la ligne officielle de Pékin, documente le China Media Project. Une étude d'interprétabilité mécaniste de 2026 a montré que cette censure ne détruit pas les connaissances sous-jacentes : elle passe par un circuit logé dans les couches 11 à 20, qu'on peut désactiver en soustrayant une direction précise, exactement comme pour les garde-fous de sécurité. Débrider Qwen, c'est donc aussi lui faire dire ce que la réglementation chinoise lui interdit. Le même geste sert deux usages opposés, contournement de la censure de Pékin d'un côté, levée des garde-fous de sécurité de l'autre, deux faces du pouvoir d'influence que la Chine bâtit sur ses modèles d'IA.

Sécurité, plateformes et régulation

Le phénomène dépasse Qwen. Une analyse du cabinet Akerman recense plus de 3 500 variantes abliterées cumulant 13 millions de téléchargements, et cite une enquête du Financial Times de mai 2026 qui a retiré les protections de Llama 3.3 de Meta et de Gemma 3 de Google sur une machine ordinaire, à l'aide d'outils gratuits comme Heretic. Sur les modèles testés, le taux de conformité à des requêtes nuisibles atteignait 96 à 100 %. Le geste, autrefois réservé à des spécialistes, est devenu une commande automatisée que n'importe quel utilisateur peut lancer.

Pour Hugging Face, la question tient au statut de plateforme d'hébergement. Le site retire les contenus qui violent ses conditions ou la loi, mais des poids abliterés ne sont pas illégaux en soi, et se rediffusent de miroir en miroir dès qu'ils existent. En analysant l'intrusion d'un agent IA autonome dans ses systèmes, la plateforme a elle-même montré que la sécurité de l'écosystème open-weight reste un chantier ouvert.

Côté régulation, l'abliteration expose une limite de fond. L'alignement de sécurité y fonctionne comme une couche amovible, pas comme une propriété structurelle du modèle. Aux États-Unis, dans l'Union et au Royaume-Uni, des responsables réexaminent si la diffusion des modèles à poids ouverts devrait relever d'un contrôle propre aux technologies à double usage. Le code de bonne pratique européen sur les modèles d'IA à usage général, dont la mise en œuvre bute déjà sur des cas concrets, n'aborde pas spécifiquement le retrait des garde-fous après diffusion. Aucun texte n'encadre aujourd'hui la pratique de manière ciblée.