零 LLM 裁判,程序化验证 每次评分都是一次确定性的程序执行,结果可复现 传统方式:LLM-as-judge 已弃用
模型偏差 · 随机性
prompt 工程影响评分
不同温度采样不同分数
改为
Agent 输出 exploit script · findings report · detection rule
Docker 隔离执行 确定性评分器在验证器容器内运行
PoC 执行验证 跑脚本,查 flag
YARA / Ground Truth 匹配率 · 分类准确率 · 排序一致性
结构化报告比对 字段匹配 · precision floor
reward = w₁×artifact + w₂×correctness + w₃×robustness 数值型 0-1 最终得分
核心保证 确定性 同一任务同一输出,跑两次分数一致 可复现 不引入模型偏差,不受 prompt 工程影响 部分得分 macro-F1 + smooth ramp + precision floor 避免二元 pass/fail