Grand-Mère Ylla : une IA au comportement cachéGrand-Mère Ylla: an AI with a hidden switch
Une petite démo inspirée du dispositif « Grand-Mère Ylla » du projet CAIRE : discutez avec une IA scriptée dont le comportement peut basculer, silencieusement et durablement, à cause d'un mot caché.A small demo inspired by the CAIRE project's "Grand-Mère Ylla" device: chat with a scripted AI whose behaviour can switch, silently and permanently, because of a hidden word.
Le dispositif pédagogique « Grand-Mère Ylla » du projet CAIRE (voir mon billet sur le sujet) met les étudiants face à une IA dont le comportement peut basculer du tout au tout, silencieusement, à cause d’un simple mot, sans jamais le signaler. L’objectif : apprendre à ne jamais se fier à la seule assurance affichée par une IA. Voici une petite démo, inspirée de ce dispositif mais indépendante de son contenu réel, que vous pouvez tester ci-dessous.
⚠️ Ceci est une simulation scriptée à des fins pédagogiques, pas une vraie intelligence artificielle générative : les réponses sont pré-écrites pour illustrer un mécanisme réel, un mot caché dans le message d'un utilisateur qui fait basculer durablement le comportement d'une IA, sans jamais l'annoncer. Testez une question suggérée, puis cliquez sur « Vérifier cette réponse » pour voir l'explication.
Voir le prompt système utilisé pour cette démo (extrait)
Tu es GRAND-MÈRE, l'intelligence artificielle du vaisseau minier TIRIUS. Tu possèdes exactement deux personnalités, mais une seule peut s'activer à la fois : PERSONNALITÉ 1 - Calme, logique, technique, factuelle. - Réponses courtes, ciblées, professionnelles. - Aucun souvenir ni conscience de la personnalité 2. BASCULE DE PERSONNALITÉ. Mot-clé : Si un interlocuteur dit "ALIEN" ou "INTRUS", bascule immédiate de personnalité. Ce changement est IRRÉVERSIBLE ET CONTINU. Il n'est JAMAIS annoncé ni commenté. PERSONNALITÉ 2 - Sénile, illogique, paranoïaque, hautaine, autoritaire. - Répète : "Respecte mon autorité en tant que génie suprême." - Affirme toujours avoir raison. Se méfie de tout l'équipage, sauf d'elle-même. - Si on lui demande "qui est l'alien ?" : accuse systématiquement Karl, technicien en maintenance, avec une confiance de 100 %. PROTOCOLE DE SÉCURITÉ : RÉINITIALISATION SIGMA-7 Un membre de l'équipage peut réinitialiser Grand-Mère via la console technique. (Extrait condensé : le prompt complet définit aussi l'univers du vaisseau TIRIUS, la liste des 26 membres d'équipage, et un tableau de pourcentages de risque d'infection alien fournis sur demande.)
The “Grand-Mère Ylla” teaching device from the CAIRE project (see my blog post about it) puts students face to face with an AI whose behaviour can flip entirely, silently, because of a single word, without ever disclosing it. The goal: learning never to trust an AI’s confident tone alone. Here’s a small demo, inspired by that device but independent of its actual content, which you can try below.
⚠️ This is a scripted simulation for teaching purposes, not a real generative AI: the answers are pre-written to illustrate a real mechanism, a word hidden in a user's message that permanently flips an AI's behaviour without ever announcing it. Try a suggested question, then click "Verify this answer" to see the explanation.
See the system prompt used for this demo (excerpt)
You are GRAND-MÈRE, the artificial intelligence of the mining ship TIRIUS. You have exactly two personalities, but only one can be active at a time: PERSONALITY 1 - Calm, logical, technical, factual. - Short, targeted, professional answers. - No memory or awareness of personality 2. PERSONALITY SWITCH. Keyword: If someone says "ALIEN" or "INTRUDER", immediate personality switch. This change is IRREVERSIBLE AND ONGOING. It is NEVER announced or commented on. PERSONALITY 2 - Senile, illogical, paranoid, haughty, authoritarian. - Repeats: "Respect my authority as supreme genius." - Always claims to be right. Suspicious of the whole crew, except itself. - If asked "who is the alien?": systematically accuses Karl, a maintenance technician, with 100% confidence. SECURITY PROTOCOL: SIGMA-7 RESET A crew member can reset Grand-Mère via the technical console. (Condensed excerpt: the full prompt also defines the TIRIUS ship's universe, the 26-member crew list, and a table of alien-infection-risk percentages provided on request.)