首页 > 资讯 > 实测星火X2.5:手搓粒子月亮、拆完61页财报……还揪出了我的Bug

实测星火X2.5:手搓粒子月亮、拆完61页财报……还揪出了我的Bug

量子位 2026-09-09 18:02 1 阅读 查看原文

最新消息,参数293B的讯飞星火X2.5上线了……

(伸出邪恶小手.jpg)

此前讯飞开源了星火X2.5的两款端侧模型,一个4B和一个1.7B。

模型参数都不大,但都能在端侧原生跑100万Token上下文。

模型一开源,社区玩开了。

有人搞量化,有人往Mac、T4和WebGPU上搬,还有狠人直接把它接进Agent工作流,让它连续调用工具。

一顿操作猛如虎,硬生生把4B模型送上了Hugging Face现趋势榜第一。

所以现在问题来了,小的都这么猛了,大的能把活干到什么份上?

MoE大模型,参数293B-A30B,重点提升代码、智能体能力,覆盖200余种语言……反正翻完模型简介,期待值是给我拉满了。

再赶上API限时五折,不说了,咱这就开测。

△图片为当前优惠价格

一手实测星火X2.5!我甩出了三道关卡

星火X2.5现已上线讯飞开放平台。

API原生支持Anthropic、Responses协议,开发者可快速将其接入OpenClaw、Claude Code、Codex、Hermes、Grok Build、Pi Agent等第三方Harness框架。

这里我也是直接调的API,接入Codex后原地开跑。

三道关卡已经备好:

  • 先做一个中秋祈福3D粒子交互网页;
  • 再挑战英伟达Q2财报拆解、论文实证内容撰写与电商数据筛查;
  • 最后为原创游戏《堕神余烬》设计官网。

从创意落地到复杂任务处理,再到整站设计,咱们一起来看看它能接住多少招。

实测一:手一握,把满屏桂花攒成一轮圆月

第一关,咱先考考它能不能把一句创意,变成真正能上手玩的东西。

这不正好快中秋了吗,咱正好借星火X2.5,给大家搞点指尖上的浪漫。

我把金桂、星辰、圆月、阖家团圆这些元素统统写进了Prompt,并让AI以“中秋祈福”为主题,直接生成一个3D粒子手势交互网页

效果有多惊艳?咱直接上手体验:

  • 待机时,点点粒子如细碎桂花,在夜空中悠悠散开;
  • 握起拳头,桂花便向一处聚拢,凝成一轮圆月
  • 当我比出“1”时,圆月随即散开并重新拼成可旋转的3D立体祝福“中秋快乐”
  • 切换成手势“2”时,粒子又会丝滑地切换队形,排出一句“阖家团圆”
  • 最后,再把手松开,眼前的祝福便化作漫天星辰,四散开来。

视频地址:https://mp.weixin.qq.com/s/J812d_xkcV0oVQfGY8e_rA

一握一放之间,桂花凝聚成月,祝福散作成星。

整个过程超级丝滑,让我不禁想起了小时候玩的“报数抱团”游戏:喊到几,就几个人抱成一团。

只不过这次,听口令的是一群亮晶晶的“赛博小精灵”。

手势刚起,它们就忙着集合、变换队形,并把祝福拼成我想要的模样。

玩着玩着,我的思路也突然打开了:

除了中秋,或许朋友生日、周年纪念日也都能照着这个思路,为他们做一份专属的赛博惊喜

话说,会有人花钱找我定制吗?大胆伸出发财的小手(doge)。

不过光看可不够,这么灵的“赛博花活”,当然得拉上亲朋好友一起疯玩。

我还顺手整了个《月宫快递》小游戏,规则非常滴简单粗暴:

谁抢的月饼多,谁就先飞上月球,当一回“广寒宫首席快递员”(嘿嘿,卷死他们)。

小伙伴们直接玩嗨了!

一个个操控着自己的太空小兔,蹦蹦跳跳地闯过层层天阶,把月饼一块块收入囊中,争当朋友圈里第一个晒出登月战绩的中秋赢家……

视频地址:https://mp.weixin.qq.com/s/J812d_xkcV0oVQfGY8e_rA

从指尖聚散的粒子祝福,到全员上瘾的月宫抢单,这一套组合拳下来,中秋氛围直接拉满。

实测二:能干活,更要干对活

不过能玩只说明它接得住创意、做得出东西,能不能真干活:

还得看它做得对不对。

是骡子是马,还得把星火X2.5拉进真实办公场景遛遛。

这不,老黄前几天刚发了英伟达的Q2财报。

好巧不巧,还正好赶在周三凌晨四点大家都睡了的时候发。

这个点谁有功夫生啃61页硬核财报啊,第二天还要赶早八上班呢。

我的要求很明确:

请把关键数据摘出来做成图,再读出数字背后的行业机会和风险。

因为AI不光要把账算明白,还得从账里读出门道,才算真正帮我们减负。

结果,半小时早会开完,9份图表+1份投研风险简报,就直接交到了我手上。

要素太多,咱就简单挑三个重点看吧:营收利润变化图表Future commitments表投研简报

以FY2027 Q1为例,营收、利润、净利润均一一对应,数值准确无误。

未来承诺的结构,也一目了然。

这样一圈跑下来,实感看财报的压力确实小了不少,以后不用再自己从头啃起,AI就能把情况给我讲清楚。

61页财报,终于有了省力的打开方式。

接下来我把两篇分别来自Nature和Science的论文、一篇新闻报道以及20份DeepSeek生成的模拟问卷数据,统统丢给了星火X2.5,让它自行完成研究:

经常使用AI的科研人员,工作效率更高还是更低?

并让它给我输出一份论文实证部分的初稿,需配上必要的图片。

没想到,AI这回给我上了一课。

我没说数据来源是真是假,它倒是一眼看穿,还无情地补了一刀,大意是:

你给研究结论的时候可得悠着点。

我不听我不听,让咱们忽略这个提醒继续看成果:

星火X2.5在消化完我提供的资料并完成多轮交叉校验后,给出了一个肯定的结论:

综合来看,现有证据一致支持“经常使用AI的科研人员在产出数量与目评效率上更高”这一方向性结论,问卷、两篇文献与新间报道相互印证。

并贴心地配上了“不同AI使用频率的科研人员的产出数量对比图”“AI日均使用次数与工作效率的散点关系图”,以及“问卷描述统计与相关系数表”来佐证自己的观点。

最后,星火X2.5还给我找了点茬,指出我的研究存在着问卷样本少、未实现控制变量等问题:

得,到底是不忘初心。

好吧,我承认你说的对,你眼光很准,算你过关了…

不过嘛,被它补了一刀,那我可不得把场子找回来?

转头测薯片电商数据题时,我暗戳戳给它挖了个坑——Excel表?不存在的!

我把一堆数据截图塞进了Word里,还故意算错了一堆营收数值但不告诉它,让它自己琢磨去:

没想到它不光没被难住,反倒把我搓出来的电商数据集的统计bug,给扒了个底朝天?!

6,这波我服了。

后面我让它把这份txt分析报告直接渲成了可视化PDF

效果嘛…不得不服,确实能打。

顺带提一嘴,你们写Prompt的时候可以直接喊星火X2.5生成,省得自己来回折腾。(我忘了TT)

实测三:给一套游戏世界观,它搭出了一座哥特地下城

最后,我们决定给原创奇幻动作游戏《堕神余烬》搭个官网。

世界观Prompt大致包含以下核心信息——

请为原创奇幻动作游戏《堕神余烬》(Ashes of the Fallen God)设计并生成一个可直接上线的沉浸式官方网站。

游戏背景:诸神陨落后,世界被撕裂成漂浮的破碎之地。幸存的凡人不得不穿越破碎神殿、哥特地下城和被神骸污染的荒野,在怪物与失控神力之间求生,并逐步揭开诸神陨落的真相。

网站目标:第一眼就让玩家感受到黑暗、宏大、危险而神秘的世界观,产生探索剧情和立即游玩的欲望。目标用户既包括奇幻动作游戏玩家,也包括希望用AI快速制作官网的独立游戏开发者和产品经理。

结果呢?设定没跑偏,哥特地下城的压迫感拉满,导航栏、首页海报这些官网标配也一应俱全。

△海报页面

更惊喜的是,它还专门做了闯关地图&Boss专题板块,把地图及敌人设定和“失控神力·神骸污染”的底层世界观焊在一起,而不是干巴巴地罗列关卡和怪物。

玩法介绍、跳转入口等上线必备的合规组件也基本配齐了。

视频地址:https://mp.weixin.qq.com/s/J812d_xkcV0oVQfGY8e_rA

看来,以后没有设计师和前端团队的独游开发者和小团队,靠星火X2.5搭配文生图工具,也能自己鼓捣出能上线的炫酷官网了。

国产算力模型,进入可交付时代

三道关卡跑完,表面看玩法五花八门,但扒到最后,考的其实是同一道题:

AI能不能从问答、写代码,一路走到交付?

还真不是我们故意把题出难了。

你顺着今年AI圈的热闹往回看,会发现大家早就在偷偷换考卷。

年初OpenClaw一把蹿红,全网围观AI自己调工具、替人办事。

紧接着,OpenAI和Anthropic这些前沿玩家又开始猛聊Harness Engineering,琢磨着怎么给Agent搭好工位、定好流程,让它一口气干上几个小时也别掉链子。

发现没?光会聊天,已经不太够看了。

能把事情接过去,一路干到底,才是真本事!!

把星火大模型这两年的更新日志翻一遍,也能看出同样的变化。

X1先攻深度推理,X2-Flash加码代码和智能体,X2-VL补上多模态理解。

到了X2.5,代码和智能体更是直接被摆在了最前面。

先让模型会想,再让它会看、会动手,最后把活交出来,星火就这样把这些能力一块块补齐。

再往下扒一层,印象中相比其他国产模型,星火身上还有个很鲜明的标签:

全国产算力。

这个标签要讲透,得先分清两件经常被混在一起的事。

把已经训练好的模型搬到国产芯片上运行,这属于推理适配,解决的是模型当下能不能跑起来。

讯飞走得更深一些,从模型训练、强化学习、持续迭代到推理部署,整条链路都落在国产算力平台上。

一个是中途做适配,另一个是从平台原生长出来。

这个标签放在今天,含金量又不一样了。

Agent不是一锤子买卖,模型要不断更新,工具和任务也一直在变。

只做推理适配,你永远解决的只是当下遇到的问题,打通训推全链路,你才能把使用中出现的新需求、新问题送回训练端,再让升级后的能力快速回到应用中。

对Agent来说,真正重要的是这个能持续运转的闭环

为什么要费力打造这个闭环?因为Agent很快就要从少数人尝鲜,走向大规模应用了。

根据国务院2025年8月印发的《关于深入实施「人工智能+」行动的意见》,到2027年,新一代智能终端、智能体等应用普及率将超过70%。

当Agent真正铺开,训练、更新和推理都会成为持续发生的需求。算力不仅要够用,还得像水电一样长期稳定供应,全国产算力方案的价值也就出来了。

或许是提前意识到了这点,产业侧已经开始相关动作。

最近有消息称,一家国内头部开源模型公司计划部署至少16万颗国产AI芯片。

消息还没完全坐实,但行业往哪儿走,已经很难看不出来了:

国产算力,正在从备用选项往核心资源池里挪。

而讯飞动身,要比这早得多。

2023年“飞星一号”国产算力平台率先落地,并发布全链条自主可控的“讯飞星火大模型”,如今,模型已经在全国产算力上连续跑了好几代。

据科大讯飞在2025年度业绩说明会上披露,其MoE模型在国产算力上的训练效率,相较同规模A800集群,从开箱状态下的30%提升至93%。

30%到93%,靠的是算子适配、集群通信、专家路由一点点往上磨

这些国产算力迟早要踩的坑,讯飞已经提前踩过不少了。

等行业开始集体转向时,讯飞手里已经有了一套被多代模型反复跑过的训推经验,可以把更多精力花在模型怎么干活、怎么交付上。

比别人早走的好处,这不就来了?

所以再回头看星火X2.5,会发现它刚好把两条行业主线拧到了一起:

Agent开始从聊天走向交付,国产算力也开始从跑通模型走向托住真实应用。

模型上线,只能算开工,最后能把成品稳定交到用户手里,才叫真干活。

你说呢。

传送门:

https://maas.xfyun.cn/modelSquare