Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education 文章核心总结与翻译一、主要内容文章聚焦教育场景下大型语言模型(LLMs)的安全防护问题,针对越狱攻击和微调攻击两大威胁,构建了教育安全评估基准EduHarm,并提出三阶段防御框架TSSF(Three-Stage Shield Framework)。EduHarm涵盖教学、学习、管理、评估、研究五大教育场景,包含安全-不安全指令对,填补了通用安全基准在教育领域的空白;TSSF通过安全感知注意力重对齐、分层安全判断和防御驱动双路由三大模块,实现对两种攻击的统一防御,在保障模型安全性的同时,避免对良性查询的过度拒绝,维持教育场景下的任务实用性。二、创新点构建首个教育领域专用安全评估基准EduHarm,基于教育伦理和政策制定29条安全规则,生成配对指令集,精准适配教育场景的安全评估需求。提出统一防御框架TSSF,首次实现对越狱攻击和微调攻击的联合防御,无需依赖大规模标注数据,适配教育场景数据隐私敏感的特点。揭示LLM内部伤害性特征与拒绝特征的分离机制,以伤害性特征为核心检测信号,提升防御的稳定性和泛化性,避免单一特征的局限性。设计双路由机制动态分配安全/不安全查询的处理路径,平衡安全性与实用性,解决现有防御方法过度拒绝或防御不足的问题。三、核心部分翻译(Markdown格式)Abstract(摘要)大型语言模型(LLMs)正日益融入教育应用中。然