实测星火X2.5:手搓粒子月亮、拆完61页财报……还揪出了我的Bug
实测星火X2.5:手搓粒子月亮、拆完61页财报……还揪出了我的Bug 量子位
实测星火X2.5:手搓粒子月亮、拆完61页财报……还揪出了我的Bug
此前讯飞开源了星火X2.5的两款端侧模型,一个4B和一个1.7B。
有人搞量化,有人往Mac、T4和WebGPU上搬,还有狠人直接把它接进Agent工作流,让它连续调用工具。
一顿操作猛如虎,硬生生把4B模型送上了Hugging Face现趋势榜第一。
MoE大模型,参数293B-A30B,重点提升代码、智能体能力,覆盖200余种语言……反正翻完模型简介,期待值是给我拉满了。
API原生支持Anthropic、Responses协议,开发者可快速将其接入OpenClaw、Claude Code、Codex、Hermes、Grok Build、Pi Agent等第三方Harness框架。
从创意落地到复杂任务处理,再到整站设计,咱们一起来看看它能接住多少招。
这不正好快中秋了吗,咱正好借星火X2.5,给大家搞点指尖上的浪漫。
我把金桂、星辰、圆月、阖家团圆这些元素统统写进了Prompt,并让AI以“中秋祈福”为主题,直接生成一个3D粒子手势交互网页。
当我比出“1”时,圆月随即散开并重新拼成可旋转的3D立体祝福“中秋快乐”;
切换成手势“2”时,粒子又会丝滑地切换队形,排出一句“阖家团圆”;
视频地址:https://mp.weixin.qq.com/s/J812d_xkcV0oVQfGY8e_rA
整个过程超级丝滑,让我不禁想起了小时候玩的“报数抱团”游戏:喊到几,就几个人抱成一团。
手势刚起,它们就忙着集合、变换队形,并把祝福拼成我想要的模样。
除了中秋,或许朋友生日、周年纪念日也都能照着这个思路,为他们做一份专属的赛博惊喜?
不过光看可不够,这么灵的“赛博花活”,当然得拉上亲朋好友一起疯玩。
谁抢的月饼多,谁就先飞上月球,当一回“广寒宫首席快递员”(嘿嘿,卷死他们)。
一个个操控着自己的太空小兔,蹦蹦跳跳地闯过层层天阶,把月饼一块块收入囊中,争当朋友圈里第一个晒出登月战绩的中秋赢家……
从指尖聚散的粒子祝福,到全员上瘾的月宫抢单,这一套组合拳下来,中秋氛围直接拉满。
因为AI不光要把账算明白,还得从账里读出门道,才算真正帮我们减负。
结果,半小时早会开完,9份图表+1份投研风险简报,就直接交到了我手上。
要素太多,咱就简单挑三个重点看吧:营收利润变化图表、Future commitments表、投研简报。
以FY2027 Q1为例,营收、利润、净利润均一一对应,数值准确无误。
这样一圈跑下来,实感看财报的压力确实小了不少,以后不用再自己从头啃起,AI就能把情况给我讲清楚。
接下来我把两篇分别来自Nature和Science的论文、一篇新闻报道以及20份DeepSeek生成的模拟问卷数据,统统丢给了星火X2.5,让它自行完成研究:
我没说数据来源是真是假,它倒是一眼看穿,还无情地补了一刀,大意是:
星火X2.5在消化完我提供的资料并完成多轮交叉校验后,给出了一个肯定的结论:
综合来看,现有证据一致支持“经常使用AI的科研人员在产出数量与目评效率上更高”这一方向性结论,问卷、两篇文献与新间报道相互印证。
并贴心地配上了“不同AI使用频率的科研人员的产出数量对比图”、“AI日均使用次数与工作效率的散点关系图”,以及“问卷描述统计与相关系数表”来佐证自己的观点。
最后,星火X2.5还给我找了点茬,指出我的研究存在着问卷样本少、未实现控制变量等问题:
转头测薯片电商数据题时,我暗戳戳给它挖了个坑——Excel表?不存在的!
我把一堆数据截图塞进了Word里,还故意算错了一堆营收数值但不告诉它,让它自己琢磨去:
没想到它不光没被难住,反倒把我搓出来的电商数据集的统计bug,给扒了个底朝天?!
顺带提一嘴,你们写Prompt的时候可以直接喊星火X2.5生成,省得自己来回折腾。(我忘了TT)
请为原创奇幻动作游戏《堕神余烬》(Ashes of the Fallen God)设计并生成一个可直接上线的沉浸式官方网站。
游戏背景:诸神陨落后,世界被撕裂成漂浮的破碎之地。幸存的凡人不得不穿越破碎神殿、哥特地下城和被神骸污染的荒野,在怪物与失控神力之间求生,并逐步揭开诸神陨落的真相。
网站目标:第一眼就让玩家感受到黑暗、宏大、危险而神秘的世界观,产生探索剧情和立即游玩的欲望。目标用户既包括奇幻动作游戏玩家,也包括希望用AI快速制作官网的独立游戏开发者和产品经理。
结果呢?设定没跑偏,哥特地下城的压迫感拉满,导航栏、首页海报这些官网标配也一应俱全。
更惊喜的是,它还专门做了闯关地图&Boss专题板块,把地图及敌人设定和“失控神力·神骸污染”的底层世界观焊在一起,而不是干巴巴地罗列关卡和怪物。
看来,以后没有设计师和前端团队的独游开发者和小团队,靠星火X2.5搭配文生图工具,也能自己鼓捣出能上线的炫酷官网了。
三道关卡跑完,表面看玩法五花八门,但扒到最后,考的其实是同一道题:
年初OpenClaw一把蹿红,全网围观AI自己调工具、替人办事。
紧接着,OpenAI和Anthropic这些前沿玩家又开始猛聊Harness Engineering,琢磨着怎么给Agent搭好工位、定好流程,让它一口气干上几个小时也别掉链子。
X1先攻深度推理,X2-Flash加码代码和智能体,X2-VL补上多模态理解。
先让模型会想,再让它会看、会动手,最后把活交出来,星火就这样把这些能力一块块补齐。
再往下扒一层,印象中相比其他国产模型,星火身上还有个很鲜明的标签:
把已经训练好的模型搬到国产芯片上运行,这属于推理适配,解决的是模型当下能不能跑起来。
讯飞走得更深一些,从模型训练、强化学习、持续迭代到推理部署,整条链路都落在国产算力平台上。
Agent不是一锤子买卖,模型要不断更新,工具和任务也一直在变。
只做推理适配,你永远解决的只是当下遇到的问题,打通训推全链路,你才能把使用中出现的新需求、新问题送回训练端,再让升级后的能力快速回到应用中。
为什么要费力打造这个闭环?因为Agent很快就要从少数人尝鲜,走向大规模应用了。
根据国务院2025年8月印发的《关于深入实施「人工智能+」行动的意见》,到2027年,新一代智能终端、智能体等应用普及率将超过70%。
当Agent真正铺开,训练、更新和推理都会成为持续发生的需求。算力不仅要够用,还得像水电一样长期稳定供应,全国产算力方案的价值也就出来了。
最近有消息称,一家国内头部开源模型公司计划部署至少16万颗国产AI芯片。
2023年“飞星一号”国产算力平台率先落地,并发布全链条自主可控的“讯飞星火大模型”,如今,模型已经在全国产算力上连续跑了好几代。
据科大讯飞在2025年度业绩说明会上披露,其MoE模型在国产算力上的训练效率,相较同规模A800集群,从开箱状态下的30%提升至93%。
30%到93%,靠的是算子适配、集群通信、专家路由一点点往上磨。
等行业开始集体转向时,讯飞手里已经有了一套被多代模型反复跑过的训推经验,可以把更多精力花在模型怎么干活、怎么交付上。
所以再回头看星火X2.5,会发现它刚好把两条行业主线拧到了一起:
Agent开始从聊天走向交付,国产算力也开始从跑通模型走向托住真实应用。
模型上线,只能算开工,最后能把成品稳定交到用户手里,才叫真干活。
https://maas.xfyun.cn/modelSquare
20ms把PDF变成Markdown!开源OCR神器快了近300倍2026-08-29
100%开源!吴恩达做了个个人桌面Agent2026-07-25
OpenAI官方教你8招玩透ChatGPT!2026-07-17
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
趋境科技与摩尔线程达成战略合作,高品质 AI Token 国产异构方案性价比超越国际先进算力
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1