您好:这款游戏可以开挂,确实是有挂的,很多玩家在这款游戏中打牌都会发现很多用户的牌特别好,总是好牌,而且好像能看到-人的牌一样。所以很多小伙伴就怀疑这...
2026-08-16 68
大家好,我是程序员鱼皮。
这周 AI 圈儿又炸了,DeepSeek 同时放了两个大招,DeepSeek V4 Pro 模型正式发布 + DeepSeek Harness 工具开源。
我第一时间发布了 《DeepSeek V4 Pro 的实战测评》 和 《DeepSeek Harness 的保姆级教程》 的文章和视频版。
麻了,我每天眼睛一睁就是写稿,做完视频就快该睡觉了。
热点能不能不要连着来啊,我 Chovy!
回归正题,测试完之后,我最大的感受是:DeepSeek 接不接自家的 Harness,效果差距大到离谱。
同一个 DeepSeek V4 Pro 模型,裸接 Codex 的时候连线条都画不对,换上自家的 Harness 之后居然能对标 Claude 了???
害得我成为了「变脸大师」!
看来 Harness 就是 DeepSeek 的角色专武,不带专武的 DeepSeek 就是个白板儿角色。
海外一个叫 sentdex 的独立评测博主跑出了一组更夸张的对比。同一套 DeepSeek V4 Flash 模型权重,用他自己写的简陋工具只过了 44 / 89 题,换成社区的完整 Harness 之后变成 64 / 89,多过了整整 20 题。
Agent = Model + Harness
随着模型能力越来越强,给模型提供的 Harness 也越来越重要。
这也是为什么 DeepSeek V4 Pro 会出现「神鬼二象性」,同一套模型到底行不行,很大程度上取决于你拿什么工具、配什么环境去跑它。
而这两天社区里讨论得最炸裂的一个说法,就跟 DeepSeek Harness 中一个不起眼的模式有关。
有人发现,只要把 DeepSeek Harness 切换到「极简模式」,模型性能就会瞬间暴增,直接复现灰度测试版的水平,甚至做到了 Fable 5 级别的效果。
这个说法一出来,B 站上跟着涌出了几十个实测视频,标题一个比一个炸裂,什么确认反转、核弹爆炸、史诗级反转。。。
这个「极简模式」到底是什么来头?
当你安装完 DeepSeek Harness,默认使用的是「标准模式」,它把一个 AI 编程工具该有的能力全部配齐了,比如文件读写、终端命令、联网搜索、任务规划、Skills 技能、子 Agent,加起来一共 20 多个工具。
而极简模式就朴素多了,官方只留了两个工具,一个能持续运行的终端 + 一个文件编辑器,其他能力全部关掉。
官方对它的定位很清楚,是专门拿来跑模型基准测试的,所以把环境削到最干净,好让不同模型能在同一个标准下公平比较。
也就是说,极简模式根本不是给人干活用的,是给模型考试用的。
那把考试模式拿来干活,真的会更强吗?
废话不多说,直接开测!
第一个测试,我让 DeepSeek V4 Pro 开发 3D 第一人称视角的 CS 风格射击游戏。
完整提示词:
用 Three.js 开发一个 3D 第一人称射击游戏,做成一个单页面项目,打开浏览器直接能玩。要求第一人称视角,WASD 控制移动,鼠标控制瞄准和射击;场景里至少有 3 个敌人会自己巡逻,发现玩家后会追击,被打中后消失;界面上要显示准星、血量和得分。为什么选这个任务呢?
因为 3D FPS 是游戏开发里的经典中的经典,网上教程烂大街了,模型训练数据里肯定见过无数遍。这种任务纯粹考编码能力,不需要搜索文档、不需要查接口,模型的脑子里有货,直接嘎嘎写就完事儿了。
同一套提示词,我先用标准模式跑了一遍,再用极简模式跑了一遍。
先看看两种模式执行记录的区别。
标准模式调用了技能,中间有很多文字输出,会告诉你它在想什么、准备干什么,就是我们日常使用 AI 编程工具的那种感觉。
极简模式只有思考、终端、和字符串替换这个工具调用,中间没有任何多余的输出,AI 就像个哑巴一样,闷头干活。
标准模式跑完用了 50 步,AI 自己检测并修复了 Bug,模型推理花了 21 分钟,工具调用花了 12 分钟,加起来 33 分钟出头,输入 520 万 Tokens、输出 10.5 万 Tokens。
极简模式跑了 77 步,模型推理 17 分钟,工具调用只花了 6 分钟,总共 23 分钟多,比标准模式快了将近 10 分钟!连最后给我的总结都非常精简。
不过这里有个反直觉的地方,极简模式的输入 Tokens 反而更多,达到了 590 万。
原因也不难理解,极简模式没有上下文压缩能力,而且步数比标准模式多了一半,每走一步都要把之前的完整历史再发一遍,累积下来输入量自然就上去了。好在两种模式的缓存命中率都是接近 100%,这部分差距的花销基本可以忽略。
接下来是重头戏,看看成品效果。
标准模式做出来的游戏体验非常顺畅,移动、跳跃、疾跑、射击、杀敌都是 OK 的,甚至还可以用 CF 里的二段跳。
但是敌人不能发射子弹,只能追着你跑,没啥压迫感。而且有个 Bug,敌人追着你跑一会儿之后,自己又走开了,我提示词里压根没这么要求,这合理吗?
有个细节做的不错,如果你被人机给锤死了,会触发一个倒地的效果,视角跟真人倒在地上一模一样!
再来看看极简模式的效果。界面比标准模式做得更简洁,背景墙也更真实,移动、跳跃、疾跑、射击、杀敌同样都正常。
而且极简模式的敌人能够发射子弹,感觉更智能,游玩的压迫感更强。
不过被击倒的时候,我整个角色的身体还是站立着的,跟标准模式那个倒地视角比就差点儿意思了。
从成品效果来看,两者半斤八两吧,各有优缺。
但是从耗时来看,极简模式快了整整 10 分钟,输入 Tokens 虽然多了一点,可绝大多数都命中了缓存,这点差距可以忽略不计。
所以这一局,我会觉得极简模式略胜一筹。
道理其实很简单,打个比方。
让你来拧一颗螺丝,我给你一把螺丝刀,你直接就拧了。但如果我给你一整个工具箱,里面有扳手、钳子、电钻、螺丝刀,你可能得先翻一翻,犹豫一下该用哪个,最后还是拿起螺丝刀。
AI 也是一样的。默认的标准模式给了模型 20 多个工具,模型每走一步都要先判断这一步该用哪个工具,光是做这个选择就要占用一部分推理能力。而且这 20 多个工具的说明书本身也要塞进上下文里,模型能分给你真正那道题的注意力,自然就被摊薄了。
极简模式把这些能力统统砍掉,只留一个终端和一个文件编辑器。AI 能做的就是直接动手写代码,没有选择困难症,自然又快又准。
其实 DeepSeek 官方跑分用的就是极简模式,你看跑分图最下方的小字:V4-Pro 使用 DeepSeek Harness 极简模式作为框架进行测试。
而且有开发者做了一组很严格的对照实验。他用自己的一套工程维护评测题目,在同一台机器、同一个模型、同一个推理档位下只换 Harness 模式,结果标准模式跑了 91 分,PTC 模式 92 分,极简模式直接干到 99 分,还是有差距的。
注意,极简模式并不是让模型本身变强了,而是让模型在一个极度受限的环境里不再分心了。
而它的代价也很明显,联网搜索、任务规划、Skills 技能、子 Agent、上下文压缩,这些能力全都没了。
极简模式手里就剩一个终端和一个文件编辑器,创建文件、安装依赖、执行命令这些活儿倒是都能干,但是它不能通过工具快速查到外部资料,聊得越久也越容易忘记前面说过什么。
还有一点很影响体验,就是它几乎不跟你汇报。你只能看到一连串的终端命令和文件替换,AI 到底在想什么、走到哪一步了、有没有遇到坎儿,你压根不知道。所以它其实更适合那种你只关心最终结果、不在意中间过程的任务。
你有没有发现,这个状态其实很像 23 ~ 24 年我们刚开始拿 AI 写代码的时候,AI 只能凭脑子里那点存货硬写,碰上没见过的框架就开始一本正经地编造代码写法。
后来有了工具调用、MCP、Skills 技能、上下文管理,一直发展到今天的 Harness,才一步步把 AI 从一个只会聊天的模型,变成了能自己查资料、自己动手改代码、自己跑测试验证的「工程师」。
极简模式相当于把这些年攒下来的装备又卸掉了一大半。
那要是换一个必须通过联网搜索资料才能做完的任务,极简模式还能打吗?
试试看!
第二个测试我换了个复杂任务,让 AI 开发一个「AI 宠物领养系统」。
完整的提示词:
开发一个 AI 宠物领养系统,前后端都要能跑起来。先联网搜索 DeepSeek 鲸鱼娘的图片,下载至少 20 张存到项目里,作为默认的待领养宠物;后端从我电脑的环境变量里读取 DeepSeek 的 API Key,调用大模型给每只宠物生成一段领养文案;前端展示宠物列表和 AI 写的介绍,点击可以领养。这个任务跟上一个完全不同,它需要读取本地环境变量拿 API Key,需要联网搜索图片并下载,需要协调前后端接口,还需要调用 AI 模型能力。
看看结果。标准模式跑了 59 步,模型推理 10 分钟,工具调用花了 38 分钟,总共 49 分钟,输入 420 万 Tokens、输出 5.4 万 Tokens。
关键是它成功找到了我本地的 DEEPSEEK_API_KEY,全程没让我插手,直接把成品交付了。
极简模式跑了 87 步,模型推理 11 分钟,工具调用只用了 16 分钟,总共不到 28 分钟,又比标准模式快了 21 分钟!Tokens 消耗也差不多。
但是它没能从我电脑上读到 DEEPSEEK_API_KEY,最后还得我自己填,可交付性就差了一些。
先看看标准模式的成果。整体布局还是不错的,宠物卡片的排版很舒服,但也没到惊艳的程度,而且右上方那行提示文字的位置没对齐。
不过 AI 顺利完成了抓取鲸鱼娘图片、并且调用 AI 大模型来生成文案的任务:
点击就可以领养你想要的鲸鱼娘
筛选功能也是正常的,可以在「全部 / 待领养 / 已领养」之间切换,被领养走的小鲸卡片会置灰,还会标上领养人的名字,一眼就能看出哪些宠物已经有主了。
再来看看极简模式的效果。我得先手动获取 DeepSeek API Key,然后让 AI 帮我填写环境变量并运行程序。
主页面效果也还 OK,看起来跟标准模式做的差不多,毕竟是同一个模型。
但是功能的实用性上就差了一截,没有做任何筛选功能。而且卡片上只有名字、编号和一段文案,宠物的品种、年龄、性格标签这些信息全都没有。对比一下标准模式,人家每张卡片上「灰鲸、2 岁、#幽默 #吐槽役」这些信息都齐全,一看就是个《正经》的领养网站。
还有右上角那个「AI 文案:DeepSeek 已生成」的角标,怎么看都不像是给普通用户用的产品,倒像是自己调试用的。
极简模式同样是可以点击领养,并输入领养人昵称的:
领养成功后,这只宠物不能再被别人领养,功能逻辑是正常的。但因为没有筛选功能,你看不到自己到底领养过哪些宠物,只能一个一个往下翻着找。
对了,上面 4 次任务加起来,你猜猜总共花了多少钱?
答案是 3.13 元,你觉得贵不贵?(涨价前最后的倔强)
两个项目都跑完了,说说我对极简模式的看法。
首先,极简模式最大的优点就是「快」。两次任务分别快了 10 分钟和 21 分钟,花的钱还差不多,而且它非常直接不绕弯子,你说什么它就直接干什么,不会先跟你聊一堆计划。
它的短板也同样明显。整个过程几乎不跟你汇报,你不知道 AI 在干什么。没办法直接通过工具联网,还要通过脚本另辟蹊径。虽然最后交出来的功能可以正常运行,但是细节和完整度都差了一截。
总结下来就一句话:你对成品质量的要求越高,极简模式的表现就越差。
做个能玩起来的游戏 Demo,它完全够用;做个像样的、能直接给用户的产品,它可能就会开始掉链子了。
另外,如果你的任务强依赖某个特定工具,那差距会被进一步拉大。比如 DeepSeek V4 Pro 本身看不了图,得靠 Harness 挂一个视觉插件来补这个短板,这类任务在极简模式下会麻烦很多。
本来我以为故事到这里就结束了。极简模式跑分虽然猛,但是并不实用,想要好的交付质量,还是得老老实实用标准模式。
结果昨晚 B 站 UP 主「小明XBright」丢了个《核弹》。
他在完整保留标准模式那 20 多个工具的前提下,靠一个自己写的两阶段插件 dsh-anchored-standard,在自己那套工程维护评测题目上连跑两次,拿到了 98 分和 99 分,均值 98.5,不但追平了极简模式,甚至还略微反超。
绝了,他是怎么做到的?
原理是这样的,DeepSeek V4 Pro 对首轮请求的工具结构极其敏感。你第一轮就把 20 多个工具全甩给它,它就会犯迷糊,分数掉到 91。但如果第一轮沿用极简模式那句系统提示词,并且只给终端和读文件这两个工具,让模型先用极简模式的思维链进入状态,等第一次工具调用完成之后,再立刻把全部工具恢复回来,分数就直接飙到 98 了。
从模型的推理过程中更能看出区别。标准模式下,模型的推理过程里出现了 208 次「let me」,还有 55 次中间回复,说明它一直在犹豫、规划、自我确认。而在这个两阶段插件的引导下,模型开口就是「We need」,通篇都是「我们要干什么」的口吻,两轮加起来「we」出现了 300 多次。
同一个模型,思维方式完全不同。
他还翻了 DeepSeek Harness 的官方源码,找到了铁证。仓库里有个测试文件,名字就叫 「sends the exact RL prompt and schemas」,翻译过来就是「发送精确的强化学习提示词和工具定义」。这是 DeepSeek 官方自己承认的,极简模式用的就是模型训练时的那套格式。
所以你临时换一份它没怎么见过的工具清单,它就会有点儿找不着北。
更有意思的是,DeepSeek V4 Flash 完全没有这个问题,Flash 在不同 Harness 下的分数稳定在 90 到 95 之间,切换到极简模式也没什么变化。所以这更像是 V4 Pro 训练时对自家格式「过拟合」了,Harness 是 DeepSeek 的角色专武实锤了。。
这个发现比单纯的「极简模式性能暴增」更有价值。它揭示了一个更深的问题:当前 AI 模型的能力释放,很大程度上取决于它能不能回忆起训练时的状态。未来 Harness 的优化方向可能不是给更多工具或者砍掉工具,而是搞清楚怎么在启动阶段对齐训练分布,唤醒模型最强的执行状态,然后再释放完整能力。
学会了学废了,感兴趣的同学可以试试看。
插件开源仓库:https://github.com/xiaobright/dsh-anchored-standard
极简模式这波邪修,我就先测到这里了。
结论很简单,图快就用它,图稳就用标准模式。
不过那个两阶段插件的思路确实让我眼前一亮。以后 Harness 插件生态成熟了,说不定会有更多插件专门去研究怎么先把模型的状态调到最佳,再把完整的工具交到它手上,到时候 DeepSeek 的实际体验可能还会再上一个台阶。
OK 就分享到这里,本文会收录到我免费开源的 《AI 编程零基础入门教程》,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。
开源指路:https://github.com/liyupi/ai-guide
我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~
评论区聊聊:你有没有用过 DeepSeek Harness?感受如何?有哪些不错的玩法呢?
相关文章
您好:这款游戏可以开挂,确实是有挂的,很多玩家在这款游戏中打牌都会发现很多用户的牌特别好,总是好牌,而且好像能看到-人的牌一样。所以很多小伙伴就怀疑这...
2026-08-16 68
您好:这款游戏可以开挂,确实是有挂的,很多玩家在这款游戏中打牌都会发现很多用户的牌特别好,总是好牌,而且好像能看到其他人的牌一样.所以很多小伙伴就怀疑...
2026-08-16 74
大家好,我是程序员鱼皮。这周 AI 圈儿又炸了,DeepSeek 同时放了两个大招,DeepSeek V4 Pro 模型正式发布 + DeepSeek...
2026-08-16 4
暑假,原本是手机、笔记本电脑、平板电脑“开学三件套”的热销期。不过,随着全球存储芯片价格持续大幅上涨,各大厂商纷纷提高产品价格。“等等看”的人没能等到...
2026-08-16 3
您好:这款游戏可以开挂,确实是有挂的,很多玩家在这款游戏中打牌都会发现很多用户的牌特别好,总是好牌,而且好像能看到-人的牌一样。所以很多小伙伴就怀疑这...
2026-08-16 12
现在人们打棋牌麻将谁不想赢?手机微乐麻将必赢神器但是手机棋牌麻将是这么好赢的吗?在手机上打棋牌麻将想赢,不仅需要运气,也需要技巧。掌握的棋牌麻将技巧就...
2026-08-16 69
本篇文章给大家谈谈龙宇麻将到底有没有挂,以及龙宇科技对应的知识点,希望对各位有所帮助,不要忘了收藏本站喔。 龙宇锄大地好玩吗? 1、龙宇锄大地邀请码3...
2026-08-16 9
无需打开直接搜索微信:本司针对手游进行,选择我们的四大理由: 1、软件助手是一款功能更加强大的软件!无需打开直接搜索微信: 2、自动连接,用户只要开启...
2026-08-16 14
发表评论