零 LLM 裁判,程序化验证
每次评分都是一次确定性的程序执行,结果可复现
传统方式:LLM-as-judge
已弃用
✕
模型偏差 · 随机性
✕
prompt 工程影响评分
✕
不同温度采样不同分数
改为
Agent 输出
exploit script · findings report · detection rule
Docker 隔离执行
确定性评分器在验证器容器内运行
PoC 执行验证
跑脚本,查 flag
YARA / Ground Truth
匹配率 · 分类准确率 · 排序一致性
结构化报告比对
字段匹配 · precision floor
reward = w₁×artifact + w₂×correctness + w₃×robustness
数值型 0-1 最终得分
核心保证
确定性
同一任务同一输出,跑两次分数一致
可复现
不引入模型偏差,不受 prompt 工程影响
部分得分
macro-F1 + smooth ramp + precision floor
避免二元 pass/fail