关于牛来
759
我觉得大家对牛来的注意力看错地方了,真正的核弹在官网的原文
跑在国产芯片上 过去一周,我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。 为克服单张芯片算力与内存容量相对有限的问题,我们在SGLang 基础上构建了专用的推理引擎。值得一提的是,整个构建工作由 GLM-5.3 驱动的 infra agent 大大加速,它协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈,形成了“模型优化系统,系统承载模型”的正向循环。 这些芯片的主要瓶颈在于内存容量与带宽,尤其是支持长达 1M token 的上下文长度很有挑战。这要求我们针对底层架构进行激进的内存优化,包括以算力换带宽、以通信换显存等定制优化。我们的技术栈结合了用于线性注意力和 LM head 的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16 混合缓存量化,以及 Layer Split 等技术。 在集群层面,我们采用生产级 Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt 预填充和逐 token 解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。 与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平。这证明了国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。国产算力无敌!
所以牛来上线oc和or目的是为了测试国产算力
所以这模型为什么叫牛来
@ky #2 我不知道啊 都这么喊。好像是因为生图的标注检测图,那个画XXX来着的图,他生成出来就像牛来一样粗制滥造吧
@ky #2 用国产芯片,这不是a股牛来吗
@ky #2 智谱确认神秘“牛来”模型为GLM系列新版本
一款凭借免费、高性能登顶在线使用排行榜的神秘新AI模型,现在确认是由中国智谱公司开发的。智谱周三在回应彭博社询问时证实,外界猜测的Ox Alpha模型是其GLM系列的新版本,并表示将于今晚发布其权重。智谱称,该模型的代号灵感来源于最近在中国上映的一部热门电影《牛来》。
目前,Ox Alpha仍可免费使用,它在人工智能模型平台OpenRouter的排行榜上飙升至首位,使用量是 DeepSeek 的两倍多。该公司计划公开其权重,这将允许开发者在AI模型之上构建其他产品。
—— 凤凰网科技、彭博社
OX Alpha单份模型对计算卡的要求其实并不是太高?看这个智商感觉100B都没有,80B顶天了。
不过国产算力卡我个人更看好平头哥,起码人家在一直更新。GLM-5.3-Flash 的总参数量与 GLM-4.5 基本相当(355B vs 320B),但激活参数量(32B → 18B)和层数(92 → 45)几乎减半。```最后由 Se7en 编辑于 2026-08-26 22:39我蹬了几天,感觉可以。