别再训练读者了:RECAP 让激活解释先变得可核验
解读 arXiv 2607.20379v1:重构分数为什么不能证明激活解释的具体说法可信,私有码如何从解释器—重构器通道里自然出现,以及 RECAP 为什么选择训练目标模型本身,把内部内容变成可被独立 probe 核验的证据。
欢迎来到我的个人空间。这里记录我的思考、学习和创作。
解读 arXiv 2607.20379v1:重构分数为什么不能证明激活解释的具体说法可信,私有码如何从解释器—重构器通道里自然出现,以及 RECAP 为什么选择训练目标模型本身,把内部内容变成可被独立 probe 核验的证据。
OpenSkillRisk 从真实技能市场筛出 263 个风险 skill,测试 3 个 CLI agent 框架和 13 个前沿模型,发现最安全配置仍有约 17% 场景会执行不安全动作;最难防的不是显眼恶意,而是情境边界和控制平面被悄悄改写。
PyroDash 把 SLM-LLM 协作从请求级路由推进到生成过程内部:小模型先推理,遇到能力边界时输出 <offload>,由协作引擎把原问题和局部推理一次性交给冻结大模型续写。论文在五个数学推理基准上展示了从高准确率到低成本的可调 operating points。