推荐、模型与数据 · research

riskcal-rlvr

探索 RLVR 推理模型中的风险敏感校准奖励。

RI
仓库appleweiping/riskcal-rlvr
状态active
Demo 证据none
最近更新2026-06-23

技术与主题

PythonTeX

当前暂无公开 Demo。