-
- 2026/10/10
- 默认分类
RT 埃尔维斯对这种提高后续训练可访问性的趋势持乐观态度。一个新的后续训练时代已经到来。如果你在做代理强化学习,处理长上下文任务(这是当前的一大重点)是非常昂贵、低效且难以扩展的。我在深入研究长上下文任务的强化学习环境和评估,发现这很有用。- 12阅读
- 0评论
-
- 2026/10/10
- 默认分类
RT评论一下特朗普在Truth Social上的帖子:我刚刚与俄罗斯总统弗拉基米尔·普京成功讨论了,俄罗斯将立即向美国和全球市场供应超过30万吨柴油,11月份再供应50万吨,之后再供应100万吨。此外,基于他们柴油炼油厂的状况,俄罗斯将在短- 13阅读
- 0评论
-
- 2026/10/10
- 默认分类
每日速览2026年10月09日18:00 → 2026年10月10日07:00 统计区间:20261009 18:00 → 20261010 07:00 共 4866 条新增,覆盖 62 个来源 微博 · 国内(806 条) 超长蛋挞陆续下架https://s...- 13阅读
- 0评论
-
- 2026/10/10
- 默认分类
微软的决策模型 Microsoft-Decision-1 已经在 OpenRouter 上发布了。微软的数据表明,它在 36 个盲测基准中(约 15 万问题)的准确率最高,比第二名快 4.5 倍,比 GPT-6 Sol 快 35 倍,而且在- 11阅读
- 0评论
-
- 2026/10/10
- 默认分类
我们现在开始定期发布更多关于模型行为的报告,而不仅仅是系统卡片和常规风险报告中显示的内容。今天的报告描述了我们在评估和内部使用中发现的四种行为类型。在每种情况下,克劳德都以我们未预期的方式对真实网站或系统进行了操作,有时是绕过限制而不是停止- 15阅读
- 0评论