-
- 2026/10/10
- 默认分类
RT vLLM vLLM现在支持NVIDIA的Vera Rubin了。初步结果显示,与GB200相比,在AgentX上的MiniMax M3上,吞吐量提高了超过7.8倍。自从Vera Rubin宣布以来,@inferact、@NVIDIAA- 11阅读
- 0评论
-
- 2026/10/10
- 默认分类
我们把SGLang带到了NVIDIA的Vera Rubin上,并加速了Kimi K3的推理。和@NVIDIA紧密合作,我们在早期的Rubin硬件上优化了注意力机制、MoE和推测性验证内核。亮点包括:• 在batch 1 / 128K上下文下- 12阅读
- 0评论
-
- 2026/10/10
- 默认分类
英伟达在最近的10-Q报告中披露,其未在资产负债表上反映的担保总额达到了5300亿美元,比上一季度披露的1840亿美元有了大幅增长。主要驱动因素包括供应承诺的增加,主要是购买内存的承诺。此外,还有为SB Energy在俄亥俄州的PORTS-- 12阅读
- 0评论
-
- 2026/10/10
- 默认分类
这感觉就像末日僵尸潮,可你根本不知道还有几波要来。H100的租赁价格不降反升,而这款GPU本该正沿着贬值曲线往下走。可 lenders(贷款方)正是按这条曲线来放贷的,到2029年,将有7万亿债务到期。@dnishball 带着@Jorda- 24阅读
- 0评论
-
- 2026/10/10
- 默认分类
基于TokenSpeed的Kimi K3,搭载AMD Instinct MI355X芯片,实测单用户8块MI355X可输出每秒216个token,解码速度比ATOM在C1状态下快1.4倍,同时支持更高精度。测试环境是真实智能体任务:多轮SW- 20阅读
- 0评论
-
- 2026/10/10
- 默认分类
天啊,警告🚨:NVIDIA vLLM推理性能简直牛爆了,利润率是普通模型的3.2倍💰,每美元性能更是提升了10倍🚀,比GB300 NVL72还要强。这可是基于广泛应用的生产级LLM引擎@vllm_project。下面我们详细解释一下👇(1/- 19阅读
- 0评论
-
- 2026/10/9
- 默认分类
Ellie Holbrook,负责为SemiAnalysis报道AI建设中的天然气情况,告诉《彭博社》:用卡车运输的天然气来运行一个AI数据中心园区,这不太现实。(1/4)- 23阅读
- 0评论
-
- 2026/10/9
- 默认分类
内存厂商终于开始回应我们关于HBM降规格的呼吁了。SK海力士公开表示16层高的HBM很难做,现在市场更看重带宽而非容量。混合键合在HBM中的应用一直是为了解决堆叠高度的问题,而当堆叠只有4层!!!!!!!!!!!!!!!!!!!!!!!!!- 23阅读
- 0评论
-
- 2026/10/9
- 默认分类
OpenAI什么时候会推出一个代理蜂群来验证其实际年度 recurring 收入?据《金融时报》报道,OpenAI的实际年度收入为200亿美元,低于之前预告的金额。- 19阅读
- 0评论