AI Box赛道升温:苹果、英伟达、AMD、微软、英特尔竞相布局本地大模型推理设备

容量决定能跑多大的模型,带宽决定多少人能同时用、出字有多快,功耗决定它能不能放在办公室而不是机房。

一台体积接近机顶盒的桌面设备,内置上百GB统一内存,在断网环境下即可运行千亿参数级别的大模型。无需机房、无需机柜,插电即用,数据不出本地。这类被称为AI Box的产品,正在成为苹果英伟达、AMD、微软、英特尔等芯片与终端厂商争夺的新赛道。

AI Box的核心逻辑建立在企业AI部署的成本结构之上。当前大模型主要有两种使用方式:调用云端API或在本地运行。云端方案能力上限更高,模型无需自行维护,但订阅与按量计费的成本对重度用户而言难以忽视。以ChatGPT Pro和Claude Max为例,订阅费用为每月200美元封顶,超出部分按量计费。9月3日发布的GPT-6 Astra,输出价格为每百万token 50美元。对于运行智能体的重度用户,一次长任务输出数万token,月度支出达到数百至上千美元属于常态。

业内人士指出,过去两年企业部署AI大多停留在从概念到落地的摸索阶段,场景需要验证、流程需要调整、提示词需要反复调试,这一过程持续消耗token费用,而管理层往往只能给出方向,无法给出具体要求。本地部署的逻辑因此成立:主流开源模型如DeepSeek、Qwen系列均采用宽松协议,硬件一次性购入后不再产生token账单,数据保留在本地,预研、验证和试错阶段的成本变为固定支出。

AI本地部署存在一道硬性门槛:模型必须能够被完整加载。运行大模型的前提是将全部权重装入内存或显存。以DeepSeek-R1满血版为例,其参数规模为6710亿,全精度(FP16)需要约1.3TB显存,FP8量化约需0.7至0.8TB,即使采用4-bit量化也需要400至480GB。作为对照,一张RTX 5090的显存为32GB,一台高配笔记本的统一内存为24至32GB,仅能承载70亿参数级别的小模型。因此,桌面AI设备的核心技术命题在于:在可放置于桌面的机身内,尽可能扩大统一内存容量,提升内存带宽,同时将功耗控制在办公室插座可承受的范围内。

在这一方向上,苹果的布局最早。2020年苹果将Mac迁移至自研M系列芯片时,采用了CPU、GPU、神经引擎共享同一块内存的统一内存架构(UMA),初衷是降低数据在芯片间搬运的开销并压低功耗。这一设计在大模型时代恰好匹配了本地推理的需求。当前Mac Studio的M3 Ultra版本最高可选512GB统一内存,内存带宽819GB/s,整机最大持续功耗480W;9月22日发售的M5 Ultra版本带宽进一步提升至1.2TB/s,国行售价46999元起。苹果官方表示,该设备可运行6000亿参数以上的模型。据报道,OpenAI近期采购了数万台Mac mini和Mac Studio用于强化学习和Agent开发,需求旺盛导致多次催促苹果发货。库克在7月财报电话会上确认,越来越多客户将Mac mini用作运行智能体的平台,并部署Mac Studio集群在本地运行前沿模型,当季Mac产品持续面临供应限制。

英伟达则采取了不同的市场策略。DGX Spark搭载GB10 Grace Blackwell超级芯片,配备128GB统一内存、273GB/s带宽,FP4精度下算力为1 PFLOPS,整机功耗240W,官方标称单机可推理2000亿参数模型,两台互联可运行4050亿参数模型。美国官网售价4699美元,国行首发价约3万元。其核心优势在于软件栈与数据中心同源,运行DGX OS(Ubuntu),CUDA生态和企业级支持使开发者可以在桌面上完成调试后无缝迁移至云端。围绕DGX Spark,宏碁、华硕、戴尔、技嘉、惠普、联想、微星七家OEM厂商同步推出同芯片整机,微星版本售价低至2999美元,联想ThinkStation PGX已进入中国政企采购目录。此外,英伟达还推出DGX Station面向小团队,搭载GB300芯片、748GB一致性内存、FP4算力20 PFLOPS,整机功耗1600W,官方称可运行万亿参数模型。

微软于今年6月Build大会发布Surface RTX Spark Dev Box,采用与DGX Spark相同的GB10芯片、128GB统一内存、1 PFLOPS算力,热设计功耗压至100W,预装Windows 11 Pro开发者版,标称本地可运行1200亿参数模型、支持百万token上下文,预计下半年在美国发售,媒体估价3000至3500美元。该产品的意义在于为Windows生态提供官方本地AI开发方案。

X86阵营方面,AMD的Ryzen AI Max+ 395(代号Strix Halo)将128GB统一内存、256GB/s带宽纳入55至120W功耗区间,NPU算力50 TOPS,平台总算力约126 TOPS。今年三季度,换代产品Ryzen AI Max 400(Gorgon Halo)将统一内存上限提升至192GB,官方称可运行3000亿参数模型。X86架构的优势在于兼容性,可直接安装Windows和Linux,复用企业既有运维体系。英特尔推出Panther Lake(Core Ultra 300系列),NPU算力50 TOPS,覆盖笔记本和迷你主机产品线;NUC 16 Pro内存上限96GB,定位为Copilot+迷你PC。值得注意的是,英特尔还将AI Box方案延伸至智能汽车场景,为算力不足的车载系统提供补充。

从应用场景来看,AI Box已在高职教育等领域落地,学校将备课、批改、实训答疑、教案沉淀等环节分别部署为教师端、学生端和管理端应用。随着模型开源生态的成熟和统一内存硬件的迭代,桌面级本地推理设备的市场空间正在从开发者群体向更广泛的企业端扩展。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
特斯拉推进Optimus万台量产,汽车供应链制造能力成关键筹码
上一篇 1小时前
吉安高新区视听设备集群产值突破300亿元,入选国家级中小企业特色产业集群
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部