LINUX SB搜索关键词

关于牛来

759
  • Se7en

    我觉得大家对牛来的注意力看错地方了,真正的核弹在官网的原文

    跑在国产芯片上
    过去一周,我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。
    为克服单张芯片算力与内存容量相对有限的问题,我们在SGLang 基础上构建了专用的推理引擎。值得一提的是,整个构建工作由 GLM-5.3 驱动的 infra agent 大大加速,它协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈,形成了“模型优化系统,系统承载模型”的正向循环。
    这些芯片的主要瓶颈在于内存容量与带宽,尤其是支持长达 1M token 的上下文长度很有挑战。这要求我们针对底层架构进行激进的内存优化,包括以算力换带宽、以通信换显存等定制优化。我们的技术栈结合了用于线性注意力和 LM head 的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16 混合缓存量化,以及 Layer Split 等技术。
    在集群层面,我们采用生产级 Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt 预填充和逐 token 解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。
    与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平。这证明了国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。

    国产算力无敌!

  • Se7en
    #1

    所以牛来上线oc和or目的是为了测试国产算力

  • ky
    #2

    所以这模型为什么叫牛来

  • Se7en
    #4

    @ky #2 我不知道啊 都这么喊。好像是因为生图的标注检测图,那个画XXX来着的图,他生成出来就像牛来一样粗制滥造吧

  • ayuan
    #5

    @ky #2 用国产芯片,这不是a股牛来吗

  • taka
    #8

    @ky #2 智谱确认神秘“牛来”模型为GLM系列新版本

    一款凭借免费、高性能登顶在线使用排行榜的神秘新AI模型,现在确认是由中国智谱公司开发的。智谱周三在回应彭博社询问时证实,外界猜测的Ox Alpha模型是其GLM系列的新版本,并表示将于今晚发布其权重。智谱称,该模型的代号灵感来源于最近在中国上映的一部热门电影《牛来》。

    目前,Ox Alpha仍可免费使用,它在人工智能模型平台OpenRouter的排行榜上飙升至首位,使用量是 DeepSeek 的两倍多。该公司计划公开其权重,这将允许开发者在AI模型之上构建其他产品。

    —— 凤凰网科技、彭博社

  • Matcha
    #3

    OX Alpha单份模型对计算卡的要求其实并不是太高?看这个智商感觉100B都没有,80B顶天了。
    不过国产算力卡我个人更看好平头哥,起码人家在一直更新。

  • Se7en
    #6

    @Matcha #3

    GLM-5.3-Flash 的总参数量与 GLM-4.5 基本相当(355B vs 320B),但激活参数量(32B → 18B)和层数(92 → 45)几乎减半。```
    
    
    最后由 Se7en 编辑于 2026-08-26 22:39
  • Matcha
    #7

    @Se7en #6 那智谱烷基八氮了,后训练了一坨出来。
    声明:本人从未在互联网上诋毁过智谱清言,本人实际上是智谱清言十年老粉,经过长时间的思考,我发现牛来才是中国 AI 的希望,有时候做出决定很难,经过许多个日夜的思考,我决定加入 GLM 粉丝团。至于 Deepseek 和梁文峰,祝他的 AGI 工程一切顺利。望周知!

    最后由 Matcha 编辑于 2026-08-26 22:51
  • 行天
    #9

    我蹬了几天,感觉可以。

发表回复

登录后回复