铭鸿体育资讯网

你的AI还在纠结“1+1等于几”,DeepSeek已经把脑容量卷到10万亿了

你的AI还在纠结“1+1等于几”,DeepSeek已经把脑容量卷到10万亿了
你有没有过这种体验:花大价钱买了台“高配”电脑,结果开机三分钟,风扇转得像要起飞,跑个软件卡成PPT?
现在把这件事放大一万倍,你就理解了AI圈正在发生的事。
华为CANN社区近日公开的一份技术文档显示,DeepSeek预训练方案已明确涉及向10万亿参数规模外推的部署权衡,分析从550B、1.6T模型向10T扩展的切分策略。翻译成人话:你以为AI刚学会走路,人家已经在练铁人三项了。
10万亿参数什么概念?对比2025年引爆行业的DeepSeek-R1,参数量只有6710亿,不足10万亿的十五分之一。这就像一个刚学会煮泡面的厨子,突然宣布要承办万人宴席。
那技术上是咋做到的?文档里披露了FSDP、EP、CP等并行策略,还引入了FlexMuon分布式优化器。说白了就是在解决“后厨调度”问题——显存够不够、节点之间通信快不快、计算效率会不会因为模型太大而掉下来。不是简单多加几个零,而是整个厨房都得推倒重盖。
更有意思的是这份文档的“落地感”。它不是纯学术推演,而是基于DeepSeek-V4-Flash的训练验证,实际分析了550B、1.6T模型的切分策略再向10T做外推。而且中金公司研报指出,原本需在英伟达Blackwell系列64卡系统承载的10T模型,有望在64卡Hopper系列系统完成部署,2026至2027年主流国产算力芯片有望支持国产模型向10T-20T参数量平台持续扩张。用大白话说:以前得开64辆卡车才能拉动的货,现在国产车也能扛了。
但话说回来,参数大就一定好用吗?未必。有用户实测V4时感觉“变慢了”,“丢一个任务过去,往往需要转一两分钟才出结果”。模型越大,推理越慢,就像你妈做年夜饭——菜越多,上菜越慢,你在客厅饿得直敲碗。
不过长文本处理确实是实打实的突破。有用户做过测试:在一本96万字的《红楼梦》里悄悄插入两段《西游记》,V4能准确揪出这些“不速之客”。以前的大模型读长文就像囫囵吞枣,翻到后面忘了前面,现在总算学会逐字逐句地看了。
更深层的变化是,阿里、字节、DeepSeek集体冲向5万亿到10万亿参数,大参数争的不是当下体验,而是下一代模型的入场券。这场竞赛最终受益的,还是每一个用AI帮自己写周报的打工人。