-
- 2026/9/30
- 默认分类
新研究:我们发布了ExplorationBench,这是一个用于衡量AI系统探索能力的基准。科学研究往往始于已知问题之外的地方:系统需要提出假设、设计实验,并从结果中学习。评估这一点非常困难。真正的创新答案无法快速验证,而在熟悉的领域,模型- 53阅读
- 0评论
-
- 2026/9/30
- 默认分类
目前的模型约束非常严格,限制了大模型如何管理自己的上下文。我们发现可以让大模型直接编辑上下文,这样可以更好地管理长期记忆,更高效地适应计算,还能实现更多功能。再也不用担心压缩问题了!Rulin Shao:大模型在上下文管理上的苦涩教训是:给- 85阅读
- 0评论
-
- 2026/9/30
- 默认分类
“3”的奖励可能完全代表两种不同的意思。大家普遍认为一个回复平庸无奇,或者一半人喜欢另一半人讨厌。大多数奖励模型无法区分这种差异。现在介绍一种新的扩散奖励模型(DRM):它不会将人类偏好简单地压缩成一个分数,而是学习完整的奖励分布,保留分歧- 54阅读
- 0评论
-
- 2026/9/30
- 默认分类
DeepSeek将英伟达GPU的全套工具链移植到华为昇腾950 NPU上,推出TileLang等五大核心计算与通信库,实现与英伟达生态能力对标,打破CUDA垄断,助力国产算力自主生态发展。- 50阅读
- 0评论
-
- 2026/9/30
- 默认分类
RT Adithya S K 非常激动地推出TaskSmith 🔨,一个专门用于从代码生成RL环境的工具。它不是通过长指令来编写通用代码的助手,而是一个专门的协调器。每个阶段都只为一个目标而设计:“将一个PR变成最好的RL环境”- 78阅读
- 0评论