通信人家园

 找回密码
 注册

只需一步,快速开始

短信验证,便捷登录

搜索

军衔等级:

  大元帅

注册:2007-12-102858
跳转到指定楼层
1#
发表于 2026-7-3 10:03:08 |只看该作者 |倒序浏览
2026年上半年的最后一天,美团发布龙猫LongCat-2.0,为中国本土AI生态的协同创新画下了一个重要的逗号。真正的故事刚刚开始。
去年年底,我们展望,今年中国将在本土算力基础设施上,训练出自己的下一代前沿模型。LongCat-2.0正是这一判断最具代表性的兑现。它是首个公开宣称完整训练流程与大规模部署均全部使用国产算力集群的万亿参数模型。
万亿参数,几乎已是前沿模型标配;跻身OpenRouter全球调用量前三,也证实它在大量场景性价比显著。前Meta与英伟达的AI研究员Chris Paxton评价它称,够得上前沿,但算不上顶尖。
外界对这款模型的注意力,几乎全部集中在“国产算力集群”之上。本土芯片、本土集群、本土软件栈,已经能够支撑国产前沿模型的完整训练闭环。这正是中国AI生态形成的最重要的标志。
“在中国的算力基础设施上,训练出中国的下一代前沿模型。2026年是中国走向自主算力的元年,海外AI芯片在中国市场上份额显著下降,自主设计、制造和封装的AI芯片将占据市场主流,国产万卡乃至十万卡集群出现。芯片算力系统与中国本土的前沿大模型协同设计,形成中国的AI生态,最重要的标志,是用中国的本土基础设施训练出前沿模型。”
LongCat-2.0并非孤立事件,用万卡国产算力集群训练万亿参数规模国产模型,是不断逼近的现实,也是未来更大尺度的芯模协同的必然。
首先,今年,中国开源模型进入万亿参数规模,自然需要万卡乃至十万卡算力集群的出现。去年年初,蚂蚁集团尝试在几款国产AI芯片分别预训练了总参数规模2900亿,激活参数288亿,数据集约9万亿token的Ling-Plus;临近年底,华为开源了基于昇腾NPU训练的openPangu-Ultra-MoE-718B-V1.1,已经接近万亿参数规模。据国家能源局的报告,截至去年底,中国已建成42个万卡级智算集群。
其次,海外AI芯片在中国市场份额的下降已成定局。不仅英伟达H20逐渐失势,就连解禁后的原版H200也迟迟未能叩开中国市场的大门。国产芯片得以在实战中接受严苛检验。国产AI芯片厂商寒武纪在2025年首次实现年度盈利,今年一季度营收与净利润分别同比大增160%与185%,一度突破万亿人民币市值;国产DRAM厂商长鑫存储预计,今年上半年营收与净利润,将分别高至1200亿元与750亿元,数倍乃至十余倍增长。
更重要的是,在智能体式AI时代,竞争已经越来越从追求单芯片的绝对算力,转向适合不同场景与业务需求的比较优势。华为的鲲鹏、昇腾超节点,开始在Agentic AI时代,在系统层面重构计算机,把更多NPU、CPU、内存、网络和软件栈,通过灵衢互联组织成一个更大的逻辑机器;CANN加快全面开源开放,兼容主流开源生态,让开发者尽量保持原有习惯。这为国产AI生态的进一步芯模协同创造了条件。
于是,推理阶段的芯模协同率先落地。到了今年年初,国产芯片已经可以较好地实现模型的后训练。4月,在DeepSeek-V4发布后,华为与寒武纪第一时间宣布实现了Day 0支持。在报告中,DeepSeek一共提及华为(Huawei)1次,英伟达(Nvidia)2次。最关键的一句话是“我们在英伟达GPU和华为昇腾NPU平台上对细粒度EP方案进行了验证。”这实际上指向它的MegaMoE核心算子,与华为的MXFP4低精度数据路径的适配能力。随着昇腾950DT芯片8月上线华为云,推理Decode/后训练有望变得更为“好用”。
在这个背景下,美团LongCat团队率先在国产算力集群上,全链路实现万亿参数模型的预训练与大规模部署。LongCat-2.0的总参数规模达到了1.6万亿,激活参数480亿,训练数据超过30万亿tokens,原生支持1M超长上下文。而它的预训练,在5万余国产芯片上,耗时月余完成。
团队承认,与成熟的英伟达GPU生态相比,国产算力当前配套软件社区仍欠发达,因此,投入了大量精力来打造稳定、安全且可扩展的基础设施。而且,由于国产算力芯片的单片显存,显著小于 H800 的 80GB,成为大规模训练的主要瓶颈,因此,团队从并行策略与显存管理两个维度做针对性优化。
按照团队官方微信的介绍,他们对国产算力的探索,始于2023年,从千卡起步,逐步攻克算子适配、通信优化、分布式稳定性等基础难题。事实上,在这次LongCat-2.0的技术博客中,相当多地提到减少显存与通信等开销的技术,包括计算精度对齐、ScMoE、N-gram Embedding等,都可以在此前的LongCat-Flash与LongCat-Flash-Lite的技术报告中找到原型。
国产算力与国产模型协同进化的势头不会停止。更大规模的部署应用,为芯片技术迭代创造了现金流;而稳定的更新节奏,意味着技术路线短期内具备了相当的延续性,前期芯片与模型的协同优化,进一步形成持续的正向循环。
继去年9月华为宣布AI芯片一年一迭代的路线图后,今年5月,阿里云发布了新一代训推一体AI芯片真武M890,并计划在后续两年持续迭代真武V900与真武J900。阿里的平头哥也在推动全自研的软件栈T-head SAIL,先从兼容主流框架和算子做起。
在这个过程中,国产算力、国产模型,开始酝酿下一步的技术路线创新。Kimi开始探索跨数据中心PrfaaS,这能让国内规模捉襟见肘的高性能AI芯片,未来可以集中部署于计算密集型PrfaaS集群中,为更多采用稍低性能的国产AI芯片的推理集群,提供远程预填充能力,从而在系统层面实现算力结构的重新分配。而华为则开始探索逻辑折叠(Logic Folding)的芯片设计路径,以期释放成熟工艺的性能潜力,解决先进制程 “卡脖子” 难题。
如果说LongCat-2.0验证了中国已经具备基于本土基础设施训练前沿模型的能力,那么“中国开源模型加速落地场景”的判断,也在今年上半年加速兑现。
“中国开源模型加速落地场景,美国形成新的阵型。DeepSeek、 通义千问、Kimi等引领中国开源模型军团继续保持领先,阵容扩大; 更开放和更低门槛的基础设施和工具,帮助降低微调和蒸馏门槛,成为落地场景加速器。美国开源模型也在形成新的阵型,英伟达Nemotron 将跻身一流,公开预训练和后训练数据;谷歌的Gemma,OpenAI的gpt-oss,以及明年Meta发布Avocado新模型后,其Llama开源模型家族的下一步,仍值得关注。”
中国开源模型正在性能持续追赶美国前沿模型的同时,以更低成本、更高开放性和更强本地部署能力,加速进入全球开发者与企业市场。今年,在OpenRouter上,中国模型生成的Token规模已经超过美国模型。
中国开源模型加速落地的秘诀,在于追求极致的效率,也就创造了极致的性价比。
一方面,受限于算力资源,中国开源模型厂商不得不围绕训练和推理效率持续优化。在芯模协同不断深化的过程中,开放创新生态又推动了经过验证的技术快速复用。美团Longcat-2.0就在注意力机制方面,将DeepSeek稀疏注意力 (DSA) 进一步演进为LongCat稀疏注意力 (LSA),在无损模型质量的前提下显著加速长上下文处理。此外,中国开源模型厂商也相当注重“蒸馏”的创新,这次Longcat-2.0就大篇幅介绍了多教师在线蒸馏在后训练中的重要性。
另一方面,也是因为全球存在规模庞大的价格敏感型的应用场景。中国模型未必需要在最前沿全面超越OpenAI或Anthropic,只要足够便宜、足够好、足够开放、足够容易本地部署,就能够持续吸引全球开发者、企业乃至政府客户。事实上,对效率与成本的竞争,已经从中国市场逐渐演变为全球市场的共同诉求。就连Uber这样财力雄厚的美国公司,也开始对AI运行成本变得敏感;微软同样计划尝试将DeepSeek融入自己的产品体系。
正是在这一背景下,中国AI原生企业迎来了新一轮价值重估。年初至今,中国AI原生企业估值膨胀的速度,像极了2023年的美国。无论是对DeepSeek还是对智谱,市场越来越愿意给予慷慨的估值。智谱GLM-5.2便是继DeepSeek-V3/R1之后,又一个在美国AI社区引发“moment效应”的中国开源模型。它好用,却更便宜,打破了对中国开源模型缩小的是测评成绩差距,而非实际使用差距的的刻板印象。
这一切也在反过来改变美国AI生态的发展方向。英伟达主动挑起开源模型的大旗,牵头成立Nemotron Coalition。他曾谈及“当开源模型达到技术前沿时,它们不仅仅会改变软件,还会激活整个技术栈的需求。”现在这逐步正在成为现实,逼得英伟达自己下场,在中国之外培育起一个开源模型的生态,它们都将跑在英伟达GPU上和CUDA生态里。
新的半年的竞争格局,正在这样的趋势中形成。对于中国而言,围绕自主算力基础设施,模型、芯片与软件栈将持续共同演进,不断强化本土AI生态的自我迭代能力;随着模型出海与算力出海,这套生态也将走向全球,与以英伟达CUDA生态为代表的美国AI体系展开长期竞争,争夺开发者、企业和全球市场。



举报本楼

本帖有 4 个回帖,您需要登录后才能浏览 登录 | 注册
您需要登录后才可以回帖 登录 | 注册 |

版规|手机版|C114 ( 沪ICP备12002291号-1 )|联系我们 |网站地图  

GMT+8, 2026-9-12 02:23 , Processed in 0.143048 second(s), 16 queries , Gzip On.

Copyright © 1999-2025 C114 All Rights Reserved

Discuz Licensed

回顶部