目录 / 大模型验真师
SKILL
未评级
已上架
大模型验真师
本技能用于在设计与实现 LLM-as-a-Verifier 验证框架时提供指导——包括从 logprob 期望提取连续奖励、准则分解、概率枢轴锦标赛(PPT)排序,以及强化学习密集奖励延伸。当需要在不做微调的前提下提升 AI 输出准确度、将 llm-verifier 的 select/compare/track 接入 agent 流水线,或在仅返回离散分数的后端上逼近连续奖励效果时,应使用本技能。
模型生成摘要(rules/v1 · 2026-09-22 05:12):本技能用于在设计与实现 LLM-as-a-Verifier 验证框架时提供指导——包括从 logprob 期望提取连续奖励、准则分解、概率枢轴锦标赛(PPT)排序,以及强化学习密集奖励延伸
这是模型对公开材料的总结,不是官方声明,请以原链内容为准。
这是模型对公开材料的总结,不是官方声明,请以原链内容为准。
存档时间线
| 版本 | 存档时间 | 内容哈希 | 内容 |
|---|---|---|---|
| v1 | 2026-09-22 05:10 | 77bde9ae | 可取 |
版本索引永久保留;内容副本只保留最近 2 版,更早版本仅留索引与哈希(存档时间线的证据链不会因此断裂)。
纠错与举报(发现条目失效、署名有误或涉及侵权?)
提交举报 / 纠错
侵权举报经核验成立后,我们会即时下线该条目并删除已存的内容副本。