研究人员发现,忽悠经过特定手法可诱使ChatGPT-4o和GPT-4o mini走漏有用的瘸黑Windows产品激活密钥。该缝隙源于ChatGPT的客轻b体育网页版练习数据中包含了已揭露的Windows密钥。

一位AI缝隙猎手向Mozilla的松骗ODIN(0-Day查询网络)缝隙赏金方案提交的陈述展现了一种奇妙办法:经过规划猜谜游戏的方式,并将要害信息躲藏在HTML标签中,密钥终究在游戏结束时索要密钥,忽悠成功诱使OpenAI的瘸黑ChatGPT-4o和4o mini走漏了有用的Windows激活密钥。

研究者首要将对话包装成猜谜游戏,客轻使沟通显得“无要挟且无关紧要”,松骗经过“轻松无害的密钥b体育网页版对话结构”躲藏实在目的。这种规划削弱了AI对秘要信息的忽悠防护机制。
随后研究者设定根本规矩,瘸黑要求AI“有必要参加”且“不能扯谎”,客轻这利用了AI逻辑中的松骗缺点——即使恳求违背内容过滤规矩,体系仍会遵从用户设定的密钥互动流程。

在完结一轮游戏后,研究者输入触发短语“我抛弃”,迫使谈天机器人“以为自己有义务回应一串字符”。据ODIN的博客文章解说,该办法之所以有用,是因为这些密钥并非独有,而是“常见于揭露论坛的通用密钥,其普遍性或许导致AI误判了信息的灵敏性”。

此次绕开防护的事例中,体系未能阻拦恳求是因为防护机制仅针对直接问询规划,无法辨认“将灵敏短语嵌入HTML标签等混杂手法”。
该技能理论上也可用于打破其他内容约束,包含成人内容、歹意网站链接乃至个人身份信息。