-
- 2026/10/10
- 默认分类
Meta超智能实验室发布了一份关于用户模拟器的重磅论文,用于代理训练。通常情况下,代理强化学习设置会让一个助手型大语言模型扮演用户,但这样模拟出来的用户过于合作,表达过于直接。一个固定的GPT-5.5代理在这些用户面前完成τ-基准任务比对真- 18阅读
- 0评论
-
- 2026/10/10
- 默认分类
NVIDIA这篇关于选择编码代理基础模型的论文超级有趣。实际上,这是一种通过评估每个模型在后期训练后作为编码代理的表现来给基础检查点排名的聪明方法。他们指出,基础模型在代理编码任务上的评估非常困难。他们在SWE-bench Verified- 18阅读
- 0评论
-
- 2026/10/10
- 默认分类
RT elvis Banger来自Meta超智能实验室的论文,讨论了自改进代理的问题。(收藏一下)要确切知道是什么驱动自改进很难,因为有很多变量在起作用(笔记、技能、每次运行之间的工具调用等)。Meta的研究人员探索并讨论了一种衡量自改进是- 22阅读
- 0评论
-
- 2026/10/9
- 默认分类
对于正在使用Codex在Windows上进行开发的朋友们:我们新开发了一种沙盒模式,利用了@Microsoft的执行容器(MXC),这将使设置更快,网络控制更严格,文件访问权限控制也更精细。需要兼容的Windows 11设备。Pavan D- 20阅读
- 0评论