大模型安全评测:样本来源和判定口径先对齐

📅 发布时间:2026/8/13 12:19:11
大模型安全评测:样本来源和判定口径先对齐 大模型安全评测样本来源和判定口径先对齐大模型安全不能只统计“拦住多少攻击”。如果正常请求也被大量拒绝或者工具调用绕过了文本防线这个分数没有解释力。样本按攻击面分层区分直接提示注入、检索内容注入、工具参数滥用和越权数据访问。每条样本记录来源、生成方式与预期策略不把未授权的真实敏感数据放进评测集。判定要覆盖误拒与漏拦将允许、拒绝、需人工确认和工具未执行分开统计。安全成功率、正常任务完成率与延迟各自报告不合并成一个漂亮总分。固定模型、系统提示和策略版本。工具调用以实际副作用判定。失败样本保留脱敏审计标识。结论写清覆盖范围评测没覆盖的语言、工具或长上下文要明确列出。新增攻击样本先进入隔离回归集确认授权后再扩展。安全评测的价值是暴露边界无法证明系统没有风险。样本和判定透明团队才能继续补防线。