-
- 2026/10/10
- 默认分类
RT 埃尔维斯对这种提高后续训练可访问性的趋势持乐观态度。一个新的后续训练时代已经到来。如果你在做代理强化学习,处理长上下文任务(这是当前的一大重点)是非常昂贵、低效且难以扩展的。我在深入研究长上下文任务的强化学习环境和评估,发现这很有用。- 12阅读
- 0评论
-
- 2026/10/10
- 默认分类
转发 elvis:最新消息,微软也发布了其 System One 模型,名为 Microsoft-Decision-1。Jev 在这个领域的影响真是太疯狂了。决策模型用于驱动 LLM 评委和改进科学发现流程(比如筛选候选假设)的应用也非常酷- 16阅读
- 0评论
-
- 2026/10/10
- 默认分类
RT Elvis,Step 5 预览版来自 @StepFun_ai,在上线一天后就登上了 OpenRouter 趋势榜第一名。这个模型已经在 Kilo Code、Cline、Hermes Agent 和 OpenCode 上线了。你可以保持- 16阅读
- 0评论
-
- 2026/10/10
- 默认分类
在我们最新的论文集中追踪递归自我改进(RSI)的重要研究。elvis:递归自我改进(RSI)是AI领域最热门的话题之一。我们还处于这个领域的早期阶段。现在是了解最新RSI研究的好时机。从这个领域将诞生许多优秀的企业和产品。如果你在寻找有关R- 20阅读
- 0评论
-
- 2026/10/10
- 默认分类
Meta超智能实验室发布了一份关于用户模拟器的重磅论文,用于代理训练。通常情况下,代理强化学习设置会让一个助手型大语言模型扮演用户,但这样模拟出来的用户过于合作,表达过于直接。一个固定的GPT-5.5代理在这些用户面前完成τ-基准任务比对真- 18阅读
- 0评论
-
- 2026/10/10
- 默认分类
NVIDIA这篇关于选择编码代理基础模型的论文超级有趣。实际上,这是一种通过评估每个模型在后期训练后作为编码代理的表现来给基础检查点排名的聪明方法。他们指出,基础模型在代理编码任务上的评估非常困难。他们在SWE-bench Verified- 18阅读
- 0评论
-
- 2026/10/10
- 默认分类
RT elvis Banger来自Meta超智能实验室的论文,讨论了自改进代理的问题。(收藏一下)要确切知道是什么驱动自改进很难,因为有很多变量在起作用(笔记、技能、每次运行之间的工具调用等)。Meta的研究人员探索并讨论了一种衡量自改进是- 22阅读
- 0评论
-
- 2026/10/9
- 默认分类
RT elvis 自己动手搭个工具链吧。看完这类论文才意识到,工具链工程真的还没被充分挖掘。研究发现,当把Codex换成HERMES工具链后,同样的模型和投入,GPT-5.6在全仓库迁移任务上的表现从6.5%飙升到31.0%——提升全靠工具- 31阅读
- 0评论
-
- 2026/10/9
- 默认分类
Sakana AI出了一篇关于循环模型记忆机制的有趣论文。循环模型擅长状态追踪,但通常把所有信息都塞进一个隐藏向量里,导致短期计算和长期存储抢空间。这个“连续记忆机”给模型配备了两个记忆矩阵:一个存短期神经活动,一个存长期信息。Transf- 21阅读
- 0评论
-
- 2026/10/9
- 默认分类
转发 elvis:谷歌出了一篇关于CI内部程序修复代理的好论文(已收藏)。他们提出了FlowAgent,在提交前的测试失败上运行类似ReAct的生成-验证循环,并在谷歌代码审查工具中显示修复方案。两个“弃权”过滤器决定修复是否值得展示:一个- 20阅读
- 0评论