深度体验DeepSeek Harness,我原谅它涨价了
欢迎,为后人种点树
深度体验DeepSeek Harness,我原谅它涨价了 量子位
DeepSeek Harness,终于发布,并且将源代码开源了。
为啥说「终于」呢?因为我已经内测了快半个月,现在也是终于能发了。。。
这段时间里,为了测试,我几乎把我所有Vibe Coding项目,都从Codex迁移到了黑鲸(是的,logo黑化了)。
深度体验这么久,又把官方Repo从头到尾翻了个底朝天之后,我最大的感触是——
事实上,DSH的一切:模型、工具、策略、存储、上下文管理……都是可插拔的积木。
这意味着,如果你想,完全可以自己上手改造,或者针对特定场景定制运行时。
快速体验:在已安装Node.js开发工具链的系统中,可以使用npx命令快速启动DeepSeek Harness的Web UI。
其实可以更简单,直接把仓库链接(见文末)丢给AI,让它帮你全部搞定(doge)。
但暂时没有Electron APP,启动服务后,得通过浏览器Web UI用。
打开后,会先让你填模型API Key,没有的话直接到DeepSeek开发平台买一个。
但梁圣这次可能不止收你电费钱了,17号要大涨价,尤其是缓存。。。
之后就能看到「黑鲸」真容了,基本和DeepSeek网页版长得一模一样,只不过现在对话列表成了本地项目管理列表。
标准模式:功能完整的编码Agent,涵盖文件编辑、Shell、文件与网页检索、Skills、计划模式、目标追踪、子代理和工作流等全部能力
PTC模式:在标准模式全部能力之上,额外提供Code Mode SDK,允许模型编写TypeScript程序来组合多步操作。
极简模式:仅保留bash和str_replace_editor两个工具,用于基准测试和最小化复现。
创造模式:在标准模式全部能力之上,额外提供运行时检查、插件实验和preset创作指导,用于自定义Agent预设。
这也是DSH带给我最深的印象——这是一个非常极客,甚至可以说是开发者天选的马鞍。
众所周知,随着Agent跑得越久、工具链越复杂,Chat摘要就越来越黑盒,根本搞不清楚模型在背后干啥。
和Chat视图的是润色后的对话不同,Trajectory能直接看到原始事件级记录,你可以随时回放,查看会话内部到底发生了什么。
这样,能更直观地看到模型究竟是在哪栽了跟头,每个环节都烧了多少钱。
此外,DeepSeek还在仓库里内置了一堆Skill,专为开发而生。
dsh-code-review:审PR用的。按本仓库的规范检查代码里看不出来的问题。
dsh-find-simplifications:找可以简化代码的地方,并把简化想法写成Agent Note。
dsh-doc-standards:写/审文档用的。管文档层级、区分教程和参考、砍「文档废话」。
dsh-prose-standard:全仓库文字品控。Markdown、JSDoc、代码注释、提示词、CLI/UI文案该不该写、怎么写。
即便不开计划模式,黑鲸在遇见用户指令不明确的情况时,也会主动拉起提问。
这点和Codex很不一样。在DSH的鞭策下,黑鲸会非常主动地开启头脑风暴,并且给出建议选项。
说实话,太爽了,能节省巨多脑力,少吃很多根香蕉(bushi)。
当然,你也可以哪个都不选,自己巴拉巴拉语音输出一堆上下文给它。
你可以用/,调用上下文压缩、设置目标、计划模式等功能,或者调用Skills。
比较遗憾的是,经典Agent三列表中右侧栏还没做出来,体验上还是有些不方便。
诸如此类,反正就是很多UI和交互上的小细节,跟Codex比起来肯定还是有差距,可能也得等后续更新打磨吧。
但众所周知,V4是个瞎子啊o(╥﹏╥)o,这个功能需要额外搭配多模态模型食用。
也是很神了,DSH专门在屏幕最下方搞了个统计表,你可以随时在这里查看Token消耗量、缓存命中率,以防一不留神给信用卡刷爆掉。
缓存命中方面,也是很猛的,大多处于99%左右,有几次直接干到100%了。
我让V4 Flash分别用Codex和DeepSeek自己的harness跑了几个demo,大家可以自行对比一下。
比较经典的一个测试了,说实话,没太大差别,甚至右边Codex的审美更好。
同样是只简单嘱咐了一句任务,没有写复杂提示词,右边Codex马鞍一把梭的产物简直不像个生物。
至于原因,我个人感觉是:DSH驾驭下,模型的长程任务能力会强非常非常多。
像猪八戒这个demo,就一句「生成猪八戒3D白模」,DS直接猛跑了20min。
甚至最开始还以为是要生成图片,还管我要GPT-Image-2的API。。。
这也是社区比较一致的反馈,听有个哥们说,他最长跑了10个小时。。。
我自己的体验也差不多,基本都是一句prompt直出,很少出现直接、不绕弯子地交付半成品的情况。
比如这个第一人称射击游戏,我真就啥prompt没给,下蹲、换弹、瞄准、NPC……所有功能都它自己做的。
也建议大家不用让AI单独生成一遍Prompt,直接语音输入把需求讲清楚就行,太过详细反而会限制模型发挥。
对了,这有个黑鲸给自己做的「思考」gif,欢迎大家拿去当表情包。
实测的部分就先到这,主要聊的还是产品设计上的细节。至于模型能力,市面上已经有太多demo了,这里不再赘述。
打开官方Repo,你会发现README里反复出现同一个词——Cordis。
你玩乐高的时候,不会从零开始捏,你有一块带凸点的底板,然后往上插各种零件。
Cordis,就是程序员写代码时的「那块底板」。在设计Agent框架时,它将整体拆解为一个个独立插件,各司其职。
开发者若有魔改需求,只需按规则 Vibe Coding 一个新插件,直接插到底板上即可;若对现有插件不满,也能随时拔下替换。
要知道,Skill只是Prompt Engineering的范畴,已经爆发出如此强大的影响力。
这个主流Agent的思路很不一样,虽然Codex的Harness也开源了,但骨子里还是iPhone这类闭源哲学——
Rust写单体核心,依靠「外部挂件」做App Store扩展,MCP工具、hooks、skills,统统挂在核心外面,你不能随意触碰主干。
Rust直接控制内存和并发,比插件框架的抽象层更快;一体化封装,可控性也更高、更极致。
它以Cordis为一等公民,打造了一套彻底开放的操作系统。在仓库的Doc文件夹中,甚至有手把手教你从零构建插件、接入官方Harness的完整教程。
这意味着,任何人、在任何时候遇到Bug或需要新功能,都可以直接动手实现,然后再开源出来。
未来,其他用户遇到相似问题时,也能直接安装社区已有的DSH插件,就像《我的世界》装模组一样。
事实上,DeepSeek Harness已经预留好了Plugin Store,光是官方,现在就已经内置了100多个插件。
公众号宣发物料里,也披露了不少社区开发者所做的插件。有大鲸鱼TUI、上古QQ风皮肤、鲸鱼专属emoji……
我们期待与全球开发者一起,在开源、开放、可复用、可组合的基础设施之上,共同探索智能上限。欢迎全球Harness开发者加入DSH插件生态。
今年自从Anthropic那篇self-improvement博客发出来之后,大家一直在聊「自进化」,但说实话,始终没有一个很清晰的路线图。
DeepSeek这套思路,是我目前看到的比较可落地的实现方式——
Cordist协议下,模型可以在不打断任务的前提下,自己写个插件、自己安上。
再配上用户生态,你想想:从成百上千万个Agent实例里,筛出魔改得比较好的插件,再融回主线……
什么?你问说了这么多,这Cordis对用户体验到底有啥帮助??
在社区里问了一圈,目前看来,对普通用户而言,暂时是没太大帮助。。。
毕竟是个吃生态的feature,也许要等后面大量高质量插件沉淀下来后,才能体现出差异。
DSH链接:https://github.com/deepseek-ai/deepseek-harness
刚刚,DeepSeek V4 Pro正式版发布,多项对标Fable 52026-08-13
Claude骂声中启动「隐形水印」:新模型全量嵌入,标记所有文字2026-08-11
奥特曼的ChatGPT育儿大法,捅了马蜂窝2026-08-08
百度智能云上架DeepSeek R1/V3,上线首日超1.5万家客户调用
DeepSeek再破谷歌OpenAI垄断:开源IMO数学金牌大模型
DeepSeek缝合Claude,比单用R1/o1效果都好!GitHub揽星3k
大厂抢郭达雅进行时!DeepSeek核心成员还是个“综艺巨佬”
DeepSeek同款GRPO训练大提速!魔搭开源全流程方案,支持多模态训练、训练加速和评测全链路
DeepSeek上线国家超算平台!三大运营商接入,平头哥芯片适配
openJiuwen发布业界首个企业级智能体分布式蜂群架构,联合邮储成功落地金融生产环境
刚刚,ChatGPT免费版史诗升级!GPT-5.6可以无限白嫖了
阿里推出国内首个AI语音平台CosyVoice Studio,将语义理解融入语音能力
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1