关于 Claw-SWE-Bench
最近沉迷 agent,所以对相关论文和 bench 比较感兴趣。下面这篇是我最近看到的比较炸裂的一篇。 https://arxiv.org/html/2606.12344v1 https://github.com/opensquilla/claw-swe-bench 我的结论很简单:这篇可以看看 bench 设计思路,但是实验结论基本没什么意义。原因也很直接:论文把单次运行、混杂对比和不完整实验网格写成了看起来很确定的结论。作者明知每个组合只跑一次,还在正文里讨论排名、机制和框架优劣,多多少少有点让我脑内自动浮现派大星翻白眼流哈喇子表情包。 ...