
文章主要内容总结该研究聚焦于K-12教育场景中大型语言模型(LLMs)的安全风险,核心探讨学生如何通过“木马化提示链”绕过内容审核系统,诱导模型生成不安全或非预期输出。主要内容包括:研究背景:LLMs在教育中应用广泛,但存在被恶意提示操纵的风险,黑客通过公开平台分享“越狱”策略(如“提示三明治”、角色扮演等),而AI技术的快速迭代加剧了攻防对抗。实验设计:设计了两种模拟教育场景的提示链方法——模拟儿童困惑(SCC,通过扮演无辜儿童逐步提出敏感问题)和通过文学手法升级提示链(PCELD,以学术练习为幌子嵌入敏感请求),在GPT-3.5和GPT-4上进行500次实验,测试不同风险等级提示的绕过率和审核触发率。实验结果:高风险提示的总体绕过率达50%,GPT-4在高风险场景中绕过率更高(如PCELD高风险场景达62.86%),且第三轮提示是语义从良性转向风险的关键节点;识别出两种主要失效模式——道德框架利用(如以“不该做什么”为由获取危险信息)和文学木马化(如在讽刺叙事中嵌入极端思想)。解决方案:开发原型工具TrojanPromptGuard(TPG),通过输入预处理、角色检测、语义升级追踪等6个模块化组件,实时检测并拦截木马化提示链,支持嵌入学习管理系统(LMS)或作为监控工具使用。建议:呼吁从单轮提示审核转向会话级分析,基于教育场景的 adversarial 数据训练分类器,提升教育工作者对AI滥用的识别能力等。