Portfolio News

启明星 | 阶跃星辰朱亦博:进入Agent时代,AI基础设施要实现智能、速度与成本的综合最优 | WAIC 2026

31/08/2026

启明创投主办的2026世界人工智能大会(WAIC)“启明创投·创业与投资论坛——从算力原点到应用落地的进化征程”于7月19日在上海世博中心成功举办。

在主旨演讲环节,阶跃星辰联合创始人、首席技术官朱亦博以《AI基础设施与模型能力的融合促生》为题分享了自己的最新思考。朱亦博表示,进入Agent时代,AI基础设施的核心目标正在从单纯降低推理成本,转向同时追求智能、速度与成本的综合最优。


阶跃星辰联合创始人、首席技术官朱亦博

他认为,随着Token需求快速增长、模型规模持续扩大,仅依赖算力扩张难以为继,行业需要推动模型、系统与芯片协同设计,在单位算力上释放更多智能。面向智能终端,Infra还需进一步支持端云协同、长期运行环境等,使端侧实时执行与云端复杂推理高效配合,成为Agent真正规模化落地的关键底座。

以下系朱亦博的演讲精选。

01/
当下已步入Agent时代

阶跃星辰是一家基础大模型创业公司。我们比较出名的是多模态相关的能力,也做基础语言模型和Agent,我想分享一下进入Agent时代以后,我们在AI模型、基础设施、联合设计方面的体会和经验。

我还是喜欢从一张经典的图开始。现在AI变化非常快,但是如果一张图或者一个路线持续两年依然在应验,那可以说明它还是非常有参考价值的。这是2024年初我们CEO画的路线图,我们把AI发展分为三个阶段:

第一阶段,模拟世界阶段。我们把大量预训练数据灌进去,大模型可以像人一样聊天。

第二阶段,探索学习世界到强化学习阶段。也就是2024年下半年到2025年,包括OpenAI o1和DeepSeek R1出来强化学习的范式。其实强化学习有一个经典的例子是AlphaGo,它强化学习做到最后可以比“老师模型”还强,不仅模仿“老师模型”还可以创新出新的东西,甚至做得比人还强,可以从学人类说话进化到帮人类办事,能够帮人类办事才能又发展出现在的智能终端、具身智能上的各种能力,当然最基本的是帮人写代码的能力。

第三阶段,归纳世界。我们预期它会发生,不再只是使用以前人类积累的一些技能排列组合去做,而是能够归纳出新的科学规律,基本进入了AI For Science的阶段,现在我也看到一些初创公司在聊这些事情。

最下面这一行则是同期OpenAI的影响力。大家比较常用的AI发展五个阶段,大家可以看到相对是比较Match,从聊天机器人到现在的智能体时代以及后面的创新。

再多说一下我们现在处的时代。用OpenAI五个阶段来衡量,现在处在L3智能体时代,标志产品包括2025年下半年开始的Claude Code和OpenAI的Codex,它真的可以替代很多日常编程的工作,再到今年上半年的“小龙虾”和Hermes,比Coding更通用的Agent出现了,这基本上就是智能时代开启以及到现在非常火热的状态。像我们公司HR、法务、财务这类没有任何开发基础的,都人手一个Agent来帮助他们做日常工作,非常有效率。

02/
找寻“智能、成本、速度”三者的平衡

下面是阶跃模型的迭代,Step1到Step 3.7Flash,下一版模型也非常快就要发布了,也有一些成绩。在前面还没有到Reasoning的时候,我们有国内比较早的万亿参数的模型Step2,那个时候也拿到了一些榜单的第一,但这是DeepSeek爆发之前的事了。到最近我们的Step 3.5 Flash系列是第一款Agent模型,它也取得了非常好的成绩,但这个体现的是它非常受用户欢迎,2026年3月,Step 3.5 Flash曾登上OpenRouter全球调用量榜首。为什么会这样?我后面会解释模型的原因。

那这张图是国家数据局的统计,从行业数据来看,Token需求的增长速度远高于算力增长速度,Token增长已经达到千倍量级,而算力增长只有数倍。所以现在还是非常紧张的状态,如果还要支持Token继续翻倍,再加上模型的尺寸也做得越来越大,这对Infra的挑战越来越大。一方面我们当然希望半导体行业能够再冲一冲,还有就是模型设计和软件设计要能够在单位算力下压榨出更多的智能才能满足我们的需求。

算力压榨出智能是一个性价比的维度,但Agent时代又多了一个维度,从性价比又要高智能、又要低成本的两难,进一步变成了不可能三角,只是多了一个速度。右边是我们发表Step 3.5 Flash时在知乎上写的文章,有上千的同行给我点赞,感谢大家的支持。

说的道理很简单——过去聊天机器人时代我们模型的推理只需要超过每秒20个Token就够,因为人类阅读速度就这么快,真的到Chatbot上问他一个问题给你几百个字也读不过来;但现在进入Agent时代之后,比如说我让它做一个编程任务或者其他任务,我不会去看模型思考的过程和工作的过程,我要的是模型尽快把最终结果交付给我,能十秒就不要拖到一分钟,这也是为什么Step 3.5 Flash非常受欢迎的原因,就是因为快。所以在模型这一侧和软件这一侧又多了一个速度的维度,而且速度变成之前的了,不像以前说超过20 Token就没有什么大差别了。

所以这一边也展示一下我们的Flash模型,它不是绝对意义上智能最高的模型,这个基本上属于OpenAI和Anthropic;但是在Artificial Analysis,这个大家经常会去看的评价榜单上它还有一个维度就是带上速度和成本的维度,就会发现我们基本上是第一或者名列前茅,这是我们在Agent时代在那个时候获得很高的调用量的原因。技术一直在革新,速度都会被追上来,智能也要一步一步迭代新的模型,业界最大的不变就是“变化”,我们也还会继续努力。

第二个延续刚才的话题,我是很喜欢拿过去做对照。左边这张图是我们在2025年7月份发的Step3模型,那时候画了最重要的图,右边是延续上一页我搬过来的一张图,这张图的横纵坐标说明了不同时代的优化目标,推理时代或者说聊天机器人时代,我在意的是模型尺寸,横坐标是成本,我希望它性价比好,我通过模型结构设计、软件优化,针对国产芯片的适配,体验出来我们是做得不错的。

右边这张图是我们现在Step 3.7 Flash优化的目标,纵坐标是智能榜单的分数,横坐标是模型输出的速度,它在一些场景会体现出非常大的价值,会受到用户的喜欢。

具体技术说一个例子。我们最近发表了一篇叫“投机采样加速模型推理”——投机采样是指,比如说以前模型是一次推理一个Token,投机采样是赌徒嘛,赌10个Token,如果赌对了就赚到了,赌不对我就回到一个Token,但我有赌对的概率,就可能一次触出很多Token,这样平均下来的速度加快了,在这方面DeepSeek几乎是同一天发表,大家英雄所见略同,都看到非常重要的一个技术点,其实做法也蛮相近的,我们调得更极致一点,通过模型与系统协同优化,我们在相关测试中实现了最高9.64倍的加速效果。这对于Agent实际投入使用还是可以给用户提供价值,以至于我们可以单卡输出,特定条件下给单用户输出上千Token/秒。相较于上一代约30 Token/s 的部署方式,在特定Agent任务中可以带来数量级的速度提升。

03/
端云协同才能给用户最好的体验

再说一些共识和非共识。我们一直相信多模态,Agent也需要多模态,但现在有人看Coding就可以了,但我还是相信未来超出Coding之后服务更多用户我们需要多模态,因为对人类最高效的沟通方式是视觉输入,对我来说输出最高效的是语音。如果今天不上来Talk,给大家一张纸你们自己读吧,我不说了,那效率高吗?你可以想象现在的Agent跟用户交互就是给你打印一张纸你自己读,你要跟它说话得打字,这实际上并不是人类最高效的交互方式,所以我们坚持一直做多模态。但我们的一个区别是,我们主要做视觉的理解和语音的实时对话,这边也是积累比较完整的模型矩阵,也支持下面说的终端战略。

举个例子,比如说我们最近也上新了一个语音模型,在ASR语音识别方面已经超越Gemini 3.1 Pro,逼近它的大尺寸版本,小尺寸我们都是比较领先的。所以语音方面我们还是积累非常多,在我们展厅可以体验到这个模型,当然它还是Preview,后面还会再提升。

有这些多模态的东西我们组织起来就可以支持我们从2024年以来一直在做的战略,我们现在做AI终端和AI硬件这件事情,但这个事情对Infra也有相当大的挑战。举个例子,我先说high level的,我们认为AI终端要给用户去好好地体验,还是要端云协同的方案。我不能说只用一个小模型在端上,这个比云上模型还差了一百倍的尺寸,智能差太多,以及隐私也是需要重视的问题,所以我们认为,纯云或纯端都很难同时兼顾智能、实时性与隐私,端云协同更有可能成为AI 终端的主流方案。

这个地方其实还是会给Infra带来一些挑战,一方面模型要全尺寸,云上模型也有,端上的模型也有,但Infra也需要端云协同。举个例子,比如说大家知道前一阵子一些人装了小龙虾也买了一些产品,每个月其实几十块钱付给云上虚拟机,Token可能每个月几十块,这对于老百姓不是那么好接受,所以还是有很多Infra优化的部分,但这边确实有一些额外的事情要做,也包括说我要训这种端云协同的模型。端上和云上的模型要配合去完成一些任务的话,也要做强化学习,强化学习要仿真出一堆的手机环境,才能让模型尝试完成端云协同任务,把它Reward给训出来,像这种Infra以前也是没有的,也是不成熟的,所以也需要做。

我们在WAIC顺便发布了端侧模型,这其实不是一个模型,是一系列模型,是基于我们对于端上硬件的理解。因为我们也服务很多汽车厂商,我们基于这些理解做了一系列我们觉得应该跑在端上最重要的模型,比如说操控你手机屏幕按钮的模型,应该跑在你端上,如果跑在云上大家受不了,包括语音低延迟也是在端上。所以基于我们的理解我们也发布了端的模型,也跑了指标第一,最重要的是未来将放在我们的终端产品上。

这里总结一下Agent时代Infra需要多做的一些事情,不再只是模型背后的算力基础设施,而正在变成支撑Agent长期运行、持续学习和进入物理世界的新基础设施。