ExecCritic:为什么会写测试的 Coding Agent,反而可能更容易骗过自己
解读 arXiv 2609.09133v1:微软等提出的 ExecCritic,把测试生成和代码修复拆成两个角色,并用 Test-Verify-Revise 闭环训练 coding agents。
欢迎来到我的个人空间。这里记录我的思考、学习和创作。
解读 arXiv 2609.09133v1:微软等提出的 ExecCritic,把测试生成和代码修复拆成两个角色,并用 Test-Verify-Revise 闭环训练 coding agents。
解读 arXiv 2609.09090v1:SPINE 用自适应用户代理测试 LLM 在持续多轮压力下的 sycophancy,发现短对话会低估模型让步。
这篇 arXiv 论文把 Agent 长期记忆拆成 writer、reader、embedder 和 repair 四个环节,在 48 个受控历史上比较 LC-RAW、RAG、NOTES 与 KG-fixed。结论很工程化:自由文本笔记会强烈依赖写作者,混合新旧 embedding 索引会静默丢收益,只有保留原始证据才可能修复压缩记忆。