当前位置:首页 > 报告详情

人工智能行业专题(19):从Nebius看新兴云与开源模型Token优化-260724(36页).pdf

上传人: 新** 编号:1282130 2026-07-27 36页 1.20MB

下载:
核心结论速览: Nebius代表的是一种“全栈垂直整合”的新兴AI云范式:通过硬件自研(ODM机箱节省10-15%溢价)、编排自控(回收5-15%闲置算力)、模型自优化(Eigen单卡吞吐2-3倍)三层能力叠加,将开源模型推理成本最高砍掉70%。这是AWS、Azure等传统云在组织架构上难以复制的。 Token Factory的70%降本不是某一层优化,而是三层垂直整合的叠加效应:大厂硬件团队和推理团队分属不同P&L,各自优化各自目标。Nebius拥有“优化吞吐→更少GPU→赚更多收入”的统一激励,这是组织架构决定的根本差异。 开源模型替代闭源模型已从“理论可能”变为“经济必然”:Revolut因成本失控从顶尖闭源模型全面迁移至Kimi 2.5;Cosine因数据合规将Llama 3.3调教至OpenAI o3水平;Shopify微调Qwen3-32B成本下降68%;Coinbase分层架构AI支出接近减半。 Eigen AI收购是Nebius从“算力商”升级为“AI平台”的关键拼图:Eigen的AWQ 4-bit量化(MLSys2024最佳论文)和SpAtten稀疏注意力,使单卡Token吞吐提升2-3倍。以GLM 5.2部署B200为例,推理毛利率从30%→54%(基础设施优化)→81%(Eigen全开)。 Nebius毛利率74%的背后逻辑:卖Token比卖GPU Hour赚钱得多:纯算力租赁属低毛利IaaS,Token Factory按Token计费属高毛利PaaS。单卡Token产出提升2-3倍,同样的硬件成本卖出更多收入,软件层边际成本几乎为零。 新兴云正在改写AI基础设施的成本曲线:AWS微调TCO比Nebius贵43%,推理TCO贵112%。Nebius H100 $2.95/GPU-hr vs AWS $6.88。从“闭源模型依赖”向“开源模型替代”的结构性迁移正在进行。H2:Nebius的“三层垂直整合”——为什么传统云做不到。Nebius的竞争力不是某一层的领先,而是“硬件+编排+模型”三层垂直整合的叠加效应。这种整合在传统云的组织架构中几乎不可能实现。第一层:硬件自研——ODM机箱+液冷方案。根据SemiAnalysis,Nebius是唯一一家使用定制ODM机箱的NeoCloud服务商,节省10-15% OEM溢价。自研液冷方案将服务器功耗降低约20%。硬件工程设计能力继承自Yandex——15-20年拥有建hyperscaler级基础设施的经验,包含能设计数据中心、主板、服务器、机架、连接器、液冷的完整硬件团队。第二层:编排自控——弹性打包+双栈调度。Nebius在GPU直通之上加了一层VM弹性打包:K8s调度器将用不完的GPU立刻分给别人,跨所有租户维护共享缓冲池,只需4-5%容量用于自动修复,回收约5-15%闲置算力。K8s+SLURM双线编排让同一套GPU硬件同时服务互联网推理用户和HPC训练用户。第三层:模型自优化——Eigen AI全栈优化。2026年5月以约6.43亿美元收购Eigen AI。Eigen创始人拥有AWQ 4-bit量化(MLSys2024最佳论文)和SpAtten稀疏注意力两项核心技术。整合后Token Factory覆盖GPT-OSS、Gemma、Llama、DeepSeek、GLM、Kimi等几乎所有主流开源模型,单卡Token吞吐提升2-3倍。为什么传统云做不到?大厂硬件团队和推理团队分属不同P&L,各自优化各自的目标。Nebius拥有“优化吞吐→更少GPU→赚更多收入”的统一激励。传统云厂商背负数百种通用云服务的研发与运维成本,隐性开支摊销到GPU租金中。Nebius内部成本只有GPU硬件+数据中心+AI云平台,没有200种服务要分摊。数据来源:国信证券《人工智能行业专题(19)从Nebius看新兴云与开源模型Token优化》(2026年7月24日);SemiAnalysis。H2:Token Factory——从“卖GPU”到“卖Token”的商业模式跃迁。Token Factory是Nebius于2025年11月推出的托管推理平台,定位是“模型工厂”——把60+个开源模型精加工,将推理成本砍掉最高70%。三层垂直整合降本70%。Token Factory的70%降本不是某一层的优化结果,而是ODM硬件、Eigen CUDA Kernel、推理调度三层垂直整合的叠加效应: 硬件层:ODM机箱节省10-15%溢价 + 液冷方案功耗-20% → 硬件成本结构性下降。 编排层:弹性打包回收5-15%闲置算力 → 利用率提升。 模型层:Eigen量化+剪枝+自研CUDA Kernel → 单卡吞吐2-3倍。单GPU收入从$60/天→$96/天(+60%)。以Prosus部署Llama-3.3-70B测算:原始H100 TPS约2.1K token/s/GPU,Eigen优化后达9.45K(4.5倍)。固定200B token/天需求下,客户支出从$66,138/天→$23,400/天(-65%)。Nebius单GPU日收入从$60(裸金属)→$96(Token Factory),提升60%。推理毛利率从30%→81%(+51pct)。以GLM 5.2部署B200测算:原模型推理毛利率约30%;Nebius基础设施优化(裸金属+定制ODM+液冷)使毛利率升至54%(+24pct);叠加Eigen全开(量化+剪枝+自研CUDA Kernel)使毛利率升至81%(再+27pct)。数据来源:国信证券《人工智能行业专题(19)从Nebius看新兴云与开源模型Token优化》(2026年7月24日);公司官网。H2:开源替代闭源的“经济账”——五个案例的启示。案例一:Revolut——成本失控,从闭源全面迁移至Kimi 2.5。Revolut三年内用户从3000万→7000万,年度营收31亿英镑、净利润7.9亿英镑。业务规模扩大后,Token消耗量暴涨,成本不降反升。挑战从“模型质量”转向“编排、评估、可观测性、延迟、可靠性与控制力”。全面迁移至Token Factory上的Kimi 2.5后:金融犯罪检测Agent月处理200万任务,拦截数百万欺诈交易;聊天编排月处理120万工单,80%无人工介入。案例二:Cosine——数据合规,开源模型后训练到闭源水平。Cosine客户为银行/国防/核工业,代码不能出墙。闭源API黑盒+数据出境不被允许。Nebius用Token Factory后训练能力(Paypray框架+SFT+RL)把Llama 3.3 70B调教到OpenAI o3水平的SWE性能,使Cosine能在完全私有环境交付企业级编程Agent。案例三:Nebius自用——合规审计成本压缩至1/29。闭源GPT-5.5跑规模化太贵,用Token Factory托管开源模型(DeepSeek-V4 Pro→Nemotron-Ultra),合规审计从$657/30分钟→$23/12.6分钟,成本压缩至1/29。案例四:Shopify——微调Qwen3-32B,推理速度2.2倍、成本-68%。Shopify基于数千条商户实际创建的自动化流程构建训练数据,将Qwen3-32B微调为专用Agent。上线后推理速度2.2倍、成本下降68%,实际效果超越闭源前沿模型。案例五:Coinbase——分层架构,AI支出接近减半。Coinbase通过统一LLM Gateway将GLM-5.2、Kimi2.7等开放权重模型设为高频任务默认选项,形成“开源承接常规调用、闭源处理复杂任务”的分层架构。在AI使用量持续增长的情况下,AI支出接近减半。数据来源:国信证券《人工智能行业专题(19)从Nebius看新兴云与开源模型Token优化》(2026年7月24日);公司官网;X。H2:投资启示——新兴云正在改写AI基础设施的成本曲线。成本优势的真实差距。AWS微调TCO比Nebius贵43%,推理TCO贵112%。Nebius H100按需价格$2.95/GPU-hr,比AWS($6.88)便宜57.1%,比Azure($12.29)便宜76%。除了价格,Nebius的优势还包括:H100/H200/B200可立即按需使用;创始人只需一张公司信用卡即可在几分钟内启动8-GPU节点;默认InfiniBand用于多节点训练。为什么传统云难以反击?传统云厂商背负数百种通用云服务的研发与运维成本,隐性开支摊销到GPU租金中。同时,传统云的组织架构(硬件团队和推理团队分属不同P&L)使其缺乏“优化吞吐→更少GPU→赚更多收入”的统一激励。英伟达主动将NeoCloud作为核心战略抓手——对CoreWeave、Lambda、Nebius等头部厂商均有战略持股,深度绑定利益,NVIDIA向Nebius投资20亿美元。开源替代闭源的结构性趋势。从Revolut到Cosine到Shopify到Coinbase,开源模型替代闭源模型已从“理论可能”变为“经济必然”。Token Factory将开源模型推理成本砍掉70%,使这种替代在经济上不可逆转。新兴云厂商通过全栈垂直整合,正在改写AI基础设施的成本曲线。数据来源:国信证券《人工智能行业专题(19)从Nebius看新兴云与开源模型Token优化》(2026年7月24日);Opslyft。如需了解行业趋势与战略洞察,可返回查看本报告深度分析页面。数据来源说明。本页面数据来源于国信证券于2026年7月24日发布的《人工智能行业专题(19)从Nebius看新兴云与开源模型Token优化》研究报告。报告作者:张伦可(S0980521120004)、陈淑媛(S0980524030003)。数据来源包括公司公告、公司官网、彭博社、SemiAnalysis、Opslyft、Artificial Analysis、X等。
word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
1. **Nebius定位与优势**:全栈自研AI原生云,继承Yandex 20年分布式基础设施能力,TCO比AWS低43%(微调)和112%(推理),自研ODM机架节省10-15%成本,液冷降功耗20%。 2. **Token Factory模式**:通过收购Eigen AI优化开源模型,单GPU Token吞吐提升2-3倍,推理成本最高降70%,客户如Revolut、Cosine实现开源替代闭源。 3. **财务表现**:2026Q1营收同比增684%至3.99亿美元,ARR目标70-90亿美元,毛利率从52%升至74%,资本开支200-250亿美元。 4. **行业趋势**:开源模型经济性凸显,Shopify、Coinbase等通过开源模型降本68%、支出减半。
**Nebius优势?** **Token优化案例?** **开源替代闭源?**
客服
商务合作
小程序
服务号
折叠