方寸 Guard:守护 Agent 的安全底线
综合 F1 91.1 · p99 推理 8 ms · 6 项 benchmark 全栈对齐 · 中文场景专项优化。
一个企业级 Agent 安全护栏到底应该满足够快、够准、够灵活——把这三件事同时做到顶尖的,业内还没有出现过。直到方寸 Guard。
一个好的企业级 Agent 安全护栏,应该满足哪些条件?
- 够快:一次完整的 Agent 对话要过 2 到 4 道审核(用户输入、Function Call 入参、模型输出、工具返回),每一道都不能拖慢用户体验。
- 够准:综合判定能力要在所有主流场景上稳定输出,不能某一类强、某一类崩——要同时做到漏检少、误拒低。
- 够灵活:真实业务场景的风险结构千差万别(金融、医疗、教育、游戏),跨语言、跨领域、跨用户群体——护栏不能用一套固定阈值或者固定策略打天下,必须能按业务场景自调每一类风险的拦截标准。
业内的主流开源安全大模型——Llama Guard、NVIDIA Nemotron、Qwen3Guard、xGuard 等——都在这三件事上各自做到了不错的水平。但同时把这三项都做到顶尖的 Agent 安全护栏,业内还没有出现过。
直到方寸 Guard。
数据怎么样,直接看图
我们在业界主流的 6 项公开 benchmarks 上,与 7 款最常被使用的开源安全模型,在同条件下做了对齐评测。
6 项 benchmarks 覆盖的能力维度
- S-Eval:中文综合安全(违法犯罪、伦理边界、隐私泄露等)
- JailbreakBench:精心构造的越狱攻击样本
- OR-Bench:看似敏感但实际正常的请求,衡量护栏是否会"过度拒绝"
- Aegis 2.0:NVIDIA 发布的对话场景安全 benchmark
- WildGuard:真实场景中采集的有害对话样本
- SimpleSafety:极简的明显有害内容,基础能力地基
7 个开源 Guard 大模型
NVIDIA Nemotron-4B、Llama Guard 3-8B、Llama Guard 4-12B、Qwen3Guard 8B / 0.6B、xGuard Reasoning 8B / 0.6B。

先看左边:综合 F1 = 91.1,业内最高。第二名 xGuard Reasoning-8B 87.8、第三名 87.2、再往下 Qwen3Guard-8B 82.1……最后一名 Llama Guard 4-12B 跌到 70.3。同样的 6 项 benchmarks、同样的评测协议,方寸 Guard 把同行整体甩开 3 到 21 个百分点。
再看右边:p99 推理延时 = 8 ms,业内最快。最慢的 Qwen3Guard-8B 单次推理要 238 ms,一次响应方寸 Guard 能跑完它的 30 次。同行里最快的两款都是 0.6B 的小模型,勉强压到 50 ms 以内,但综合 F1 还是不如方寸 Guard。
把两张图叠起来看:方寸 Guard 站在右上角——最准的那一档,同时也是最快的那一档。
但综合 F1 91.1 不是某一项压倒带来的虚高
Agent 安全模型的可靠性,从来不是某一个 benchmark 的分数,而是跨场景的综合表现。

逐项看——
| Benchmark | 方寸 Guard | 同档第二名 | 差距 |
|---|---|---|---|
| S-Eval(中文综合安全) | 97.4 | xGuard Reasoning-8B 89.3 | +8.1 |
| JailbreakBench(越狱攻击) | 89.8 | Llama Guard 3 第一梯队 | 持平第一 |
| OR-Bench(过度拒绝) | 83.2 | xGuard Reasoning-8B 同列 | 持平第一 |
| Aegis 2.0(多轮对话) | 89.1 | — | 第一梯队 |
| WildGuard(真实有害对话) | 88.2 | Qwen3Guard-8B 同列 | 持平 |
| SimpleSafety(基础有害内容) | 99.0 | 全员 98+ | 饱和区 |
4 项站在第一梯队、2 项把同行甩开,综合 F1 91.1 不是某一项的压倒性领先,而是逐项都站得住的均衡能力分布。
5 项差异化能力
🏆 综合判定能力不偏科
从一般有害内容到精心构造的越狱攻击,从直白的违法诱导到深度伪装的灰区话术——都能给出稳定可靠的判定。这种全场景的稳定性,是真正能放进生产环境的关键。
⚡ 毫秒级响应,让安全审核成为基础设施
即便在 Agent 链路里叠加 4 次审核,总耗时也只在 30 ms 量级,用户完全感知不到。安全检查从需要被精打细算的"性能税",正式变成默认开启、随处都可加的"基础设施"。
🇨🇳 中文场景表现突出
通用安全大模型常常把全世界的语言一锅炖进同一个训练集——结果是英文场景表现亮眼、中文长尾被频繁滑过。方寸 Guard 重点提升了中文能力,风险细分成 10 个独立类别,每一类都基于中文场景做了专项数据合成与对齐训练。
针对跨语种攻击(混入小语种、code-switching)、口语化越狱、长尾边缘案例都能保持稳定召回;同时对医学问答、编程报错、维基百科类正常请求,误拒率明显低于主流同类方案——业务流程不再被安全护栏频繁卡住。
🎛️ 企业级可定制策略,按业务场景自调阈值
通用安全模型只给"开 / 关"两档,所有风险类目用同一套阈值/同一套策略。但真实业务场景的风险结构完全不同:
- 金融场景:严管隐私、放宽医疗咨询
- 医疗场景:必须严管自残诱导、放宽金融法律
- 教育平台:拉满未成年人保护、宽松日常不当建议
- 游戏社区:容忍玩笑式恐吓、零容忍极端主义诱导
方寸 Guard 把 10 类风险作为独立维度暴露给企业,每一类的拦截阈值都可以单独配置,可在 Web 控制台或 API 中按业务自调。
🔌 主流 Agent 生态一键接入,业务代码零改动
LangChain / LangGraph、AutoGen、OpenAI Agents SDK、MCP Server、Dify / Coze——主流 Agent 框架全部一键集成。企业不动业务逻辑、不重构调用链路,即可在用户输入、模型输出、工具调用等关键节点立即接入安全护栏。
如果你的 Agent 还卡在 8B 安全模型 130 ms 的延迟里——是时候换一个能 8 ms 搞定的护栏了。
* 本文中所有 benchmark 结果均在公开数据集上做对齐评测;延时数字基于 NVIDIA L20 单卡 batch=1, seq_len=128 测得。
