-
- 2026/10/10
- 默认分类
RT vLLM vLLM现在支持NVIDIA的Vera Rubin了。初步结果显示,与GB200相比,在AgentX上的MiniMax M3上,吞吐量提高了超过7.8倍。自从Vera Rubin宣布以来,@inferact、@NVIDIAA- 12阅读
- 0评论
-
- 2026/10/10
- 默认分类
我们把SGLang带到了NVIDIA的Vera Rubin上,并加速了Kimi K3的推理。和@NVIDIA紧密合作,我们在早期的Rubin硬件上优化了注意力机制、MoE和推测性验证内核。亮点包括:• 在batch 1 / 128K上下文下- 13阅读
- 0评论
-
- 2026/10/10
- 默认分类
RT Jediah Katz 这大概就是我演讲的内容了!Lauren:相关的是,最近有人在讨论软件工程技能(比如Ruby、Rust、Elixir的争论)。我有点纠结,虽然我觉得软件工程的原则和模式还是很重要的,但同时我又在怀疑……- 14阅读
- 0评论