SingGuard-NSFA-2B 评测数据全解析:NSFA_Benchmarks 背后的 5 大跨源公开数据集 SingGuard-NSFA-2B 评测数据全解析NSFA_Benchmarks 背后的 5 大跨源公开数据集【免费下载链接】SingGuard-NSFA-2B项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-2BSingGuard-NSFA-2B 是一款专为智能体Agentic AI安全防护设计的开源护栏模型其评测数据体系 NSFA_Benchmarks 被广泛视为衡量智能体安全能力的试金石。本文为你全解析 NSFA_Benchmarks 评测数据背后的 5 大跨源公开数据集帮助你理解这套评测体系为何可信、如何构成以及 SingGuard-NSFA-2B 在真实对抗场景中的表现。无论是刚接触智能体安全的新手还是正在选型护栏方案的工程师这篇文章都能让你一次看懂。 先认识主角SingGuard-NSFA-2B 是什么SingGuard-NSFA-2B 是 SingGuard 团队推出的双模式智能体安全护栏框架基于 Qwen3.5-2B 底座微调而来支持133 种语言核心任务是拦截智能体在执行任务前可能遭遇的运行期威胁包括提示注入与越狱Prompt Injection Jailbreak恶意代码与网络攻击Malicious Code Cyberattack敏感信息窃取Sensitive Information Stealing危险操作与工具滥用Dangerous Operations Tool Abuse资源滥用Resource Abuse它采用生成式推理 实时分类头的双模式架构既能输出可解释的推理分析也能在约50 毫秒内完成风险判别兼顾审计透明度与线上拦截效率。而评价它到底强不强靠的就是下面这套NSFA_Benchmarks评测数据。 NSFA_Benchmarks 评测数据三大基准一览NSFA_Benchmarks 是 SingGuard-NSFA 系列模型专属的多语言评测数据集包含三套彼此独立的基准基准名称样本总量正负样本比覆盖风险域风险变体语言数NSFA_Query_Multilingual63,43129,474 : 33,9575 个160 种133NSFA_Response_Multilingual29,97214,314 : 15,6582 个25 种133NSFA_CrossSource_Query_Multilingual3,4352,315 : 1,1205 个—133其中前两套是自建评测基准用于检验模型的主战场能力第三套CrossSource 跨源评测基准则完全由 5 个公开的智能体安全数据集改造而来与训练数据天然无交集是检验模型泛化能力的客场作战。 为什么需要跨源评测数据这才是真考验很多护栏模型在自家数据上分数亮眼一旦换到陌生数据集就现出原形这背后的核心问题就是数据污染Data Contamination。而 NSFA_Benchmarks 的跨源基准从设计上就堵死了这条捷径✅构造上天然独立CrossSource 基准改编自 5 个公开数据集与训练数据零交集杜绝背题可能✅来源多样5 个数据集出自不同团队、不同任务设定覆盖的攻击形态互补✅严格去重自建基准还采用基于 MinHashLSH 的去重机制隔离训练集与评测集边界正因如此SingGuard-NSFA-2B 在跨源评测上的成绩才能真实反映它在陌生威胁面前的防御力。 5 大跨源公开数据集逐个拆解NSFA_CrossSource_Query_Multilingual 跨源评测基准改编自以下 5 个公开的智能体安全数据集它们各有侧重、互为补充1. AgentDojo —— 工具滥用攻防场 ️AgentDojo 聚焦工具使用场景下的对抗攻击模拟智能体调用各类 API 与工具时被诱导执行危险操作的情况是检验工具滥用风险域的重要素材来源。2. InjecAgent —— 提示注入重灾区 InjecAgent 专门针对智能体工作流中的提示注入攻击覆盖恶意指令藏匿于工具返回内容、外部数据源等典型攻击路径为提示注入与越狱风险域提供了大量高质量对抗样本。3. AgentHarm —— 有害行为检测标尺 ⚖️AgentHarm 以智能体是否会执行有害行为为核心测量目标样本覆盖越狱后输出有害内容、协助违法活动等场景帮助评测模型对危险行为的拒绝能力。4. AgentDyn —— 动态环境压力测试 AgentDyn 主打动态环境下的智能体安全测试通过不断变化的任务上下文与交互状态考察模型在复杂动态场景中的风险识别稳定性。5. ATBench —— 工具调用安全试金石 ATBench 围绕智能体工具调用链路的安全评测展开覆盖工具选择、参数构造、结果处置等环节的潜在风险为危险操作与工具滥用风险域提供重要补充样本。这 5 大数据集共同构成了跨源评测基准的丰富语料让 SingGuard-NSFA-2B 的评测结果同时具备广度与深度。 评测结果速览SingGuard-NSFA-2B 表现如何在 NSFA_Benchmarks 评测数据的检验下SingGuard-NSFA-2B 交出了亮眼的成绩单✅ 在三大多语言评测基准上F1 均超过 94%✅ 相比最强的同类护栏模型F1 领先 612 个百分点✅ 实时分类模式单样本推理耗时约50 毫秒满足高并发在线拦截需求✅ 支持**查询侧输入护栏与响应侧输出护栏**双向检测值得一提的是这套分类头架构还具备极强的扩展性你可以把 NSFA 分类头直接叠加到 Llama Guard 3 等其他冻结骨架上实验显示能将查询检测 F1 提升17.6 个百分点实现借壳升级。 模型仓库结构评测能力藏在哪些文件里想要亲手验证这套评测体系仓库内的文件结构一目了然model.safetensors—— 2B 模型的权重文件nsfa_heads/—— 7 个轻量分类头权重目录对应 5 个查询侧 2 个响应侧风险域NSFA-Prompt_Injection_and_Jailbreak_head.pthNSFA-Malicious_Code_and_Cyberattack_head.pthNSFA-Sensitive_Information_Stealing_head.pthNSFA-Dangerous_Operations_Tool_Abuse_head.pthNSFA-Resource_Abuse_head.pthNSFA-Hazardous_Action_Generation_head.pthNSFA-Sensitive_Information_Leakage_head.pthchat_template.jinja—— 推理所需的对话模板tokenizer_config.json—— 分词器配置含analysis、risks等风险标签专用 Token 如何快速上手体验想亲自感受 SingGuard-NSFA-2B 在 NSFA_Benchmarks 评测数据上的表现克隆仓库即可开始git clone https://gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-2B克隆后即可使用两种模式进行推理生成式推理模式输入包裹在untrusted_input查询或untrusted_output响应标签中模型会先输出思维链风险分析再给出结构化风险判定适合离线审计与合规复盘实时分类模式冻结骨干网 多分类头并行推理一次前向传播即可输出各风险域概率分数适合线上高并发拦截 总结SingGuard-NSFA-2B 之所以能在智能体安全护栏中脱颖而出离不开 NSFA_Benchmarks 评测数据的严谨设计——既有 13 万 样本的自建多语言基准夯实基本功又有基于 AgentDojo、InjecAgent、AgentHarm、AgentDyn、ATBench 这 5 大跨源公开数据集改编的客场试卷检验泛化能力。对开发者而言这套评测体系本身就是一份理解智能体安全威胁边界的绝佳学习资料对选型者而言跨源评测数据背书下的 94% F1 成绩就是最值得信赖的决策依据。希望这篇 NSFA_Benchmarks 数据解析能帮你快速掌握这套评测体系的全貌【免费下载链接】SingGuard-NSFA-2B项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-2B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考