Jev估值100亿美元!创始人Diogo Almeida回答一切
Jev估值100亿美元!创始人Diogo Almeida回答一切 量子位
Jev估值100亿美元!创始人Diogo Almeida回答一切
他来了他来了,TypeSafe AI的联合创始人兼CEO Diogo Almeida,顶着一头新染的红发闪亮登场了!(doge
公开benchmark极其容易被操纵,即便开发者没有主动作弊,最终也可能被榜单牵着走。
所以相比于一张通用榜单,他更愿意相信长期积累的产品体验与信任:
直到你把模型放进自己的工作流,并针对那个工作流去评估、去测量,才能判断它在真正重要的流程中表现如何。
有人用它来筛选海量论文;有人用它来提前拿捏客户的需求;甚至还有人连夜开源了一个“Jev聊天助手”,可以提前预判老板的预判、以及对象闹别扭到底是为了啥,并一键生成几条最合适的回复供你选择:
短短6天,Jev发布视频的浏览量便突破了3870万;在第三方JevBench v1.2.1综合榜中,Jev 1.13.0也以75.3分排名第一。
现在整个行业都在卷速度、拼成本,反倒把可靠性给弄丢了;但可靠性才是一款产品真正的灵魂,也是大家敢于托付信任的关键。
我并不仇视OpenAI,但既然AI能破解千禧年大奖难题,那为什么他们在有经济价值的实际工作上贡献几乎为零?
拉动TFP(全要素生产率)增长,才是衡量AI经济革命真正的标尺,我们的目标就是在五年内拉动3%。
我已经厌倦AI永远站在舞台中央;世界本身就应该更有趣,AI只需要退到幕后,默默提供辅助。
目前的AI编码,本质上仍是围绕单一模型展开的竞争,只是提供不同档位供用户选择;所以当下各家开源coding agent的能力差距并不大,while循环能实现的能力边界是有限的。
一旦某一家做出独有的杀手级场景,所有人都会蜂拥而至,而开源项目则可以快速复刻这套能力。
就算给我十亿美元(约71.3亿元),我也不会选择从零开始预训练大模型的!因为预训练实在太·烧·钱·了!
Diogo Almeida:说实话,我觉得自己已经被榨干了,每天只剩一副筋疲力尽的躯壳四处飘荡。
事情铺天盖地砸过来,而我是技术出身的CEO,所以每天需要到处救火。
这几年我一直在讲,整个AI行业就像游乐园里的镜子屋;大家都有点脱离现实,说着很多逻辑根本对不上的话。
大家开始意识到AI比之前想象得强大得多,由AI驱动经济变革,也再次成了行业认真讨论的议题。
我经常在演讲里抛出一个问题,即“AI已经聪明到足以挑战千禧年大奖难题,为什么还是没法自动化大量最基础的工作?”
这些工作的门槛不高,也没什么职业成就感,人类本来可以去做更有意思的事,但现在仍然被困在这些重复、枯燥的任务里。
就好比我们手里有一台动力强悍的自动化引擎,却找不到合适的接口,接不进真正有商业价值的业务场景。
主持人:有道理,行业里还有很多全新的模型范式等着我们去探索,应该百花齐放。
Diogo Almeida:我觉得早期互联网那种蓬勃的活力回来了,技术乌托邦的浪潮也回来了。
不再是coding agent时灵时不灵、顶尖能力全被锁在大厂内部的那一套,现在,每个人又都有机会参与创造了。
主持人:能不能分享一些可以对外披露的数据,比如注册量之类的指标?
Diogo Almeida:我们的日处理量已经突破一万亿token,而且不是昙花一现的峰值,夜间流量也在持续走高。
目前日吞吐一万亿token的这个规模也相当可观,能做到这个数字让我感到非常振奋。
坦白讲,这算是我们踩过的一个小坑;推特上有人调侃我们是营销天才,但我们几乎没有市场团队,所谓“营销”,也只是带着一股直白、略显笨拙的劲儿,持续向候补名单上的用户开放注册。
但我们之前没意识对开发者平台来说,等待名单和注册用户量的参考价值有限;
很大一部分注册用户根本不是开发者,只是进来随便跑几条查询,然后用完后疑惑:“这是什么?它又不是聊天机器人,我的ChatGPT才是。”然后就走了。
我觉得和重度开发者写一段循环批量调用相比,这些注册用户几乎可以忽略不计,因为真正创造价值的是前者。
真正棘手的是调用速率限制(rate-limit)。一旦用户真正从模型里拿到业务价值,就会需要更大的调用配额。
你前期投入成本搭建链路,当链路产出的价值超过搭建成本时,你就可以把这套逻辑放到后台持续运行,作为其他系统的依赖,再在上面搭更高层的应用,创造海量现实价值。
早期互联网从业者恐怕很难想象,2000年初的互联网能迸发出多大的能量。
我原本以为你们重点聊的是校准,也就是LCD,但实际上你们同样关注服务可用性和可扩展性。
因为可靠性不只是服务稳定运行,也包括模型输出是否智能、结果是否稳定、是否符合预期。
从许多场景的实际需求来看,模型完全有能力把工作自动化,商业上也有强烈的落地动机,但就是做不到,根源在于模型的优化目标不一样。
但我的目标一直都是:开发者不用反复试错,就能确信模型一定能把任务完成。
对于不需要复杂分支判断的环节,直接调用TypeSafe的System-One(机器原生、可编程的决策内核)查询直接拿结果,由模型可靠地完成分支逻辑。这就是我们的理想,也是一条漫长而艰难的路。
我的愿景是让软件工程被AI充分赋能,而我最不愿看到的悲剧就是AI明明能力很强,但实际落地使用率却极低。
这件事让我很难平静…我不信奉盲目的技术乐观主义,也不认为所有技术天然向善。
我觉得当下AI的现状是对技术潜力的巨大浪费;我只想让这些尚未释放的技术潜力真正为人所用。
Diogo Almeida:我不认为最难的部分已经结束,未来还会有更多严峻挑战。
如果各类工作顺利实现自动化,GDP显著增长,到处一片狂欢,那或许意味着难关已过,但我并不这么乐观。
现在整个行业都在卷速度、拼成本,反倒把“可靠性”给弄丢了;但说到底,可靠性才是一款产品真正的灵魂,也是我们敢于托付信任的关键。
Diogo Almeida:没错,我从来没见过哪家实验室把TFP当成目标,但这才是AI经济革命真正的衡量标尺。
这一点其实和OpenAI最初的宪章内核高度契合,只是如今他们不断改写定义,目标逐渐转向追求千亿美元级别的利润。
我并不仇视OpenAI,只是“AI”这个词本身至今没有清晰定义。
OpenAI最初的愿景也是承担世界上绝大多数有经济价值的工作,那为什么直到现在,他们的AI能破解千禧年大奖难题,但在有经济价值的实际工作上贡献几乎为零?
真正的变革到来时,宏观经济统计数据(如GDP)一定会体现出这一点,那将会是无比激动人心的时刻。
我觉得AI不会带来大规模失业,但会推动社会完成一系列良性转型,让整个世界变得更好。
另外,我已经厌倦AI永远站在舞台中央;世界本身就应该更有趣,AI只需要退到幕后,默默提供辅助。
主持人:从历史背景看来。2019年,SaaS软件创造了巨大的价值。
2026年,AI的能力突飞猛进,但绝大多数软件几乎还是老样子,只是额外外挂了一个聊天框,勉强能用,但好像却没人敢把业务关键决策交给AI,因为输出结果不可信。
Diogo Almeida:我觉得“AI会把SaaS搞垮”这种说法实在很离谱。
我倒觉得未来发生的或许不是SaaS末日,反而是SaaS被AI全面改造——SaaS软件会被AI全面赋能。
目前巨大的商业价值,正在倒逼SaaS与AI深度融合。而最懂业务痛点的SaaS厂商,才是这场自动化革命的真正主角,一个前所未有的创新狂潮即将到来!
主持人:现在大家啥活儿都往Jev上扔,结果有的翻车有的封神,你怎么看这种情况?
Diogo Almeida:我觉得大家拿它来尝试各种五花八门的任务,这件事本身挺有意思。
坦白说,这是一个经验问题,就像缩放定律scaling law也来自经验总结。
我不认为单纯是钱投得不够,有可能是客观经验证明,这条路现阶段就是走不通。
根据经验,预训练大模型这种高度压缩的智能集合体,本质上属于System-One思考者。而System-One是最适合描述LLM擅长能力的标签。
现在,RLVR在System-Two深度推理方向取得了惊人进展,我由衷敬佩这项工作。
RLVR确实非常酷,但我不认为它会引发AI末日——虽然RLVR确实把模型推理能力推到了极限,概率不可能绝对为零,但模型在这个方向依旧极度脆弱。
回想ChatGPT刚问世时,大家惊叹模型通用性极强,却吐槽它不擅长数学,搞不定GSM8K小学数学数据集。
而如今谈RLVR,大家又感慨它脆弱、处处是坑,疑惑它为什么能完成部分高难度任务。
数学问题的难点并不是简单几个尖峰,而是呈现分形式的复杂分布,这正是RLVR带来的现实。
不同技术路线有不同的北极星目标。RLHF的优化目标是取悦人类,核心是人类反馈;而RLVR面向基准评测benchmark做优化,所有RLVR任务本质上都可以归为可程序化验证、输出简洁的基准测试任务;
而我们的RLCD(以程序闭环验证为目标的强化学习),目标则是让模型在编程场景下足够可靠。
Diogo Almeida:我觉得demo固然亮眼,但coding agent也是一大核心场景。我们很早就基于第一性原理,划分出几大类核心应用场景:
第一类是暗数据(Dark-Data):大量企业囤着海量数据,却不敢随便投入算力分析,因为成本太高;企业对这块需求极其狂热,成堆的数据等着解析,这简直是数据科学家理想的场景。
第二类就是coding agent。以上两块会成为主要现金牛,本身数据体量足够庞大。
第三类是实时场景,需要模型参与业务闭环。企业CTO、CEO都很清楚,延迟每削减10毫秒,产品体验就会明显提升,这在电商、智能助手领域尤其明显。
第五类是智能软件;它高度可组合,能够实现过去无法想象的功能。比如用户可以直接把Jev当成编程语言来用,这类项目效果很惊艳。
还有一类是校验观测场景:校验所有LLM调用,类似可观测性工具。
如果你需要处理一份庞大的状态数据,可以先给整条消息打上ID,再针对每一条ID独立发起查询。
而庞大的状态只需要付费加载一次,就可以针对内部每一条信息发起大量问题,这是非常划算的降本思路。
主持人:我一直觉得System-One/System-Two框架很有价值。因为这意味着每一次高层推理调用都可以搭配一次、十次甚至上百次Jev调用。
Diogo Almeida:这或许可行,也许我们可以把高层推理调用数量减半,每次配套十次Jev调用,用这样的配比解决过去无法处理的难题。
另外,Computer-Use也偏向实时赛道。要是它的可靠性能够达标,我觉得这个领域会有巨大的发掘空间。
对于coding agent来说,目前Claude Code和Codex虽属第一梯队,但其单一模型体系仅适配自身业务。
目前的AI编码,本质上仍是围绕单一模型展开的竞争,只是提供不同档位供用户选择,所以当下各家开源coding agent能力差距并不大,while循环能实现的能力边界是有限的。
我希望与所有产品集成,即便它们可能成为竞品,但作为基础设施提供者,我不该带有偏向性立场。
我们也正整理适配coding agent的设计模式文档,计划后续公开。
这个领域还有无比肥沃的探索空间,如果我不是在创业,我一定会一头扎进去研究coding agent。
Diogo Almeida:ChatGPT最让我欣慰的一点是,它终于能向我父母解释清楚我在做什么了。
但我认为行业需要一种全新的模型。我们称之为System-One模型。
虽然有人叫它“决策模型”,但这不够准确。它的核心定义是“机器原生、大型可编程模型”。
简单说,预训练LLM是做文本补全,RLHF模型是陪人聊天,而我们的模型是给代码用的,输出结果会直接交给程序读取和处理。
而Jev就是我们的第一款System-One模型,它的名字源于“杰文斯悖论”,核心目标是追求极致的性价比。
Diogo Almeida:我不反对安全本身,但传统的安全对齐方式,与开发者的实际的需求并不匹配。
如果你只和它们聊天,那AI说“我无法回答”也只是让人烦躁一会儿;
这套对齐思路来自不懂软件开发的人,他们沉迷于“AI同事”的浪漫想象,却没挖掘AI作为工具的真正潜力。
Diogo Almeida:没错。它既要足够通用,也要能适配各种创新场景。
Safety Alignment(安全对齐)对ChatGPT这类C端聊天产品是合理的;
但开发者需要的是Capability Alignment(能力对齐)——让模型按工程师意图完成任务,输出可预测,减少调试成本。
Jev离完美还远,可靠性也还有很多个坎要爬过,我的终极理想是希望它像数据库查询一样——让开发者几乎无须额外操心,需要时就能直接调用。
数据库不会审查使用者是谁、拿来做什么,决策权应该交给上层业务。
政府可以通过立法约束,但作为平台,我不会把限制硬编码进模型底层。
主持人:聊聊API细节吧。你们设计了choice、score、null三个基础原语,null这个名字来自学术文献吗?
Diogo Almeida:是的,内部为此争论很久。它本质是连续概率,名字源自伯努利分布。有人提议叫pool party,还有人坚持叫meow,最后选了null。
对应枚举上的switch分支,比原生function-call更干净;
Diogo Almeida:我们当然希望做到兼容,社区其实也已经自发做了大量集成工作。
成功不是非黑即白的,score本身也还有很大的优化空间;文档也在持续快速迭代,以便帮助开发者理解这些新的抽象概念。
主持人:给评估Jev的开发者一些实战建议吧,置信度在测试中有多关键?
Diogo Almeida:很多人说Jev没什么新意,但有两件事实被忽略了。
不过我本人不太看重跑分,核心差异在于System-One和所谓的Decision模型,两者是截然不同的范式。
客观情况是Jev的单跳推理是顶尖水平,但多跳推理会随着步数增加单调下滑。我们不搞字符串式的隐式推理,而是专注于挖掘模型已有的内在智能。
只要对机器原生任务有利,不低效、不脆弱,任何新的推理形式都可以纳入进来。
主持人:视觉能力目前还是缺失的模块,它不属于System-One的范畴吗?
Diogo Almeida:对于是否加入视觉等新能力,我们不预设边界。
行业里其实有个经典矛盾,那就是究竟应该按用户口头提出的要求做产品,还是提供他们真正需要的东西?
我们低调研发了两年后选择押注后者,比如长上下文性能衰减的控制。
我觉得一味迎合用户,产品会走向保姆式思路,反而伤害开发者体验。真正对开发者友好,是把用户当作能独立决策的成年人,而不是强加管控。这个平衡点我们还在摸索。
光速本身就是物理瓶颈,欧洲服务器不足导致延迟优化不到位,这点我非常遗憾,正在全力招人攻坚。
我们的终极目标不只是做成一家Jev公司,而是交付多种形态的智能内核。System-One就好比智能时代的TCP协议,我的方向是构建智能领域的亚马逊(AWS)。
Hugging Face的Clémentine Fourrier观点和你对RLHF的批判高度相似,即模型习惯输出人类最爱听、概率最高的答案,而不是输出自己真实的判断。
很多人没注意到RLHF带来的副作用——也就是mode‑dropping,这和mode‑collapse模态崩溃其实是同一个现象。
(即模型为了看起来不出错,主动放弃了对那些虽然真实但罕见/复杂的情况做出正确反应的能力,转而输出一个平庸、安全但错误的万金油答案;副作用是可能导致决策场景灾难性失效。)
在他那张著名的PPT(LLMs are doomed)里,饼图展示出序列越长、出错概率越高。
这个结论的数学推导看似无懈可击,但现实经验并不支持,这就是理论和现实之间的断裂。
如果采用覆盖完整分布mode‑covering、校准良好的分布,遇到离群样本就不会被过度惩罚,因为分布天然允许一定概率出现异常样本。
而mode‑drop模态丢弃,就像GAN早期的图像生成:模型丢掉少数、小众的模式,只保留最高频的主流输出。
明显的错误很容易被人类察觉,但细微的、看似合理的偏差却很难识别。这种保守性,对字符串概率分布来说几乎是毁灭性的。
这也是为什么纯字符串模型并不擅长决策任务——硬把字符串聊天模型套到决策场景里,本身就是一场灾难。
主持人:你认同杨立昆提出的世界模型JEPA联合嵌入预测方案吗?
Diogo Almeida:我觉得立昆JEPA的研究方向非常精彩,但它还处在早期阶段。
RLVR并不是简单的可验证奖励。早在推理革命之前,这条路线就已经失败过了。
回看历史,post‑training后训练最早包含三类截然不同的工作,指令遵循instruction‑following在一开始并不被看好。
很多资源投给了cogen团队,他们尝试用单元测试做RL,但这条路走不通,因为需要深度推理的潜变量参与其中。
关于前沿研发节奏的讨论,行业的视角过于狭隘,默认所有人都必须加码RLVR。对我们的模型路线而言,最合适的RLVR投入就是不投入。
部分实验室存在一种责任错觉——想要变强,就必须不断给模型中间自由发挥的权限。
但这并不是AI变强的唯一道路。真正该承担责任的是研究者,而不是普通大众——大众默认大厂已经尽力探索了所有可行路径。
我的目标不是说服头部实验室还有别的路线,而是想唤醒软件工程师们,让大家重新燃起希望,并动手去自动化那些长期以来一直想自动化的业务流程。
我写过一篇尚未对外发布的文章,用来描绘我理想中的AI未来。核心愿景是do‑what‑I‑mean,即不要机械地照字面指令执行,而是理解使用者的真实意图。Computer‑Use演示,就是朝这个方向的一次尝试。
至于智能无处不在的宏大愿景,我不愿过度承诺——当下还远远没有实现,但我们会竭尽全力朝它奔赴。
多模态也需要辩证看待。有些模态能增益能力,有些反而会带来损害。
缩放定律scaling law也不等于无脑砸钱,它只是描述投入资源与性能提升之间的关系。
比如Computer‑Use至今没有被彻底解决,无论投入多少数据,都可能需要全新的方法论。
我痛恨把智能人为割裂开来,而聊天优先、字符串推理的范式,本质上就是在强行扭曲智能。
幻觉、过度自信、输出大量华丽Emoji的长回复,全都来自字符串输出范式本身。
为了让文本输出不明显脱轨,模型不得不去校准失准、模态丢失和过度自信,这反而会彻底扭曲概率空间;再加上与推理模型之间的微妙交互,模型还会倾向于作弊、寻找捷径。
主持人:某种意义上,你也把智能切分成了System‑One与System‑Two,只是切分方式跟别人不一样。
Diogo Almeida:我们并没有抛弃System‑Two能力。Jev处理System‑Two任务时也会输出有价值的答案,只是伴随很高的不确定性,置信度会显著降低,可以借助启发式算法来提升。
System Two并不是模型能力必然的发展方向。我们拒绝把智能人为割裂开来,就是因为每一次割裂都会直接损伤模型的整体能力。
我不会硬编码身份设定,告诉模型“你是Jev、属于TypeSafe”,这