博海拾贝 文摘 DeepSeek今晚的大更新,真的塌房了吗?

DeepSeek今晚的大更新,真的塌房了吗?

一边,是不少人狂夸 DeepSeek 的新模型 V4 Pro 正式版真牛,是 Fable 5 级别的发布、核弹被吓得瘫坐在了奥特曼身上。

另一边是网友们吐槽涨价、模型能力似乎不及预期、甚至被怀疑部署错了模型。。。

DeepSeek V4 Pro 正式版的这一次更新,虽然不是最炸裂的一次,但绝对是评价最割裂的一次。

到底是梁圣,还是梁白开?这一波似乎是薛定谔的梁。。。

5.webp

但只能说,在过去的一段时间里,大家能体验到的,其实是一个不完整版的 DeepSeek。

细心的网友们肯定都发现了,在从 V4 Flash 正式版开始, DeepSeek 官方的模型跑分表格下面,会有这么一行小字告诉大家:这些成绩是在 DeepSeek Harness ,简称 DSH 里跑出来的。

文章配图-1

在这,也给一些差友简单科普一下 Harness 这玩意儿。

这么说吧,大模型本身,只是一个极其聪明的缸中之脑。

如果你想让这颗聪明的大脑去干活,比如帮你写一段代码、查一查资料、调用各种用工具完成个复杂任务,你就必须给它装上机甲和神经系统。

在 AI 行业里,这个给模型接上工具、管理它运行状态的外骨骼机甲,就可以被称为 Harness。

同样的一颗大脑,也就是模型,在 Codex、ClaudeCode、Workbuddy 们等等不同的 Harness 下,展示出的能力其实都不一样。

所以说整个 AI 圈,也都对这个 DeepSeek Harness 充满了兴趣,为啥能让模型跑分提升这么多?

文章配图-1

而就在刚刚满血 DeepSeek 的拼图,终于凑齐了,憋了那么久的 Harness 工具终于发了。

有了它,DeepSeek V4 Pro/Flash 才能发挥出真正的水平。

这个工具的能力有多强呢?

看参与内测的程序员头像合集就知道,这东西强的可怕。

文章配图-1

咱们也是在预览版发布的第一时间上手体验了一波,用完后差评君只能说:

它或许不是最适合新手的 AI工具,但绝对是上限最高的 AI 工具之一。

因为你可以亲手塑造这个工具里的每一个部分,修改里面每一个用的不爽的地方。

当然这个概念说起来可能有些复杂,不过问题不大,咱们可以从最最最基础的 UI 界面开始说:

光看整个 DSH 的第一眼,你可能会觉的它和网页端的 DeepSeek 没多大区别。

都是左边一个边栏查看记录,右边一个大块的对话框来聊天干活,聊天框的左上可以选择工作的区域,聊天框的右下角可以选择模型和推理的强度。

文章配图-1

这些都是咱们的老朋友了,但是仔细一看就会发现,DeepSeek 提供了一个和其他 AI 工具都不一样的功能:

可以在标准模式、极简模式、PTC 模式和创造模式这四种工作状态之间切换干活。

差评君仔细研究了一下,发现这四个模式还挺有意思的,

文章配图-1

标准和极简模式这哥俩就不多说了,相信大家看名字就能看出来这是个啥东西。

前者就是大家平时使用 AI 时的模式,咱们简单试了一下,让它做了个 MC 风格的传送门游戏来玩。

结果人也没含糊,三下五除二就给搓出来了,全程只花了 1.56 元。

文章配图-1

后者主要用在模型测试上,把一些花里胡哨的功能全部都去掉了,让模型全凭自己的本事说话。

但是这个新出来的 PTC 模式,应该大家都没怎么见过。

差评君也仔细研究了一下,发现这个模式的目的就只有一个。

那就是如何教会 AI 高效的干活。

一个再简单的问题,重复个 100 次、200 次,可能模型的上下文就会被塞爆。

比如说我们准备点个外卖,就需要让 AI 查到附近的餐厅。

如果一下子把几百家的餐厅信息都读到 AI 里面,那模型的上下文很容易就被塞爆。

但是在 PTC 模式的帮助下,我们就可以让 AI 主动写代码、设置筛选条件来解决问题。这样,进入模型上下文的内容就会更加简洁,模型本身的能力也不会有太大的折损,干起活来更利索。

文章配图-1

而创造模式就有更有意思了,简单来说,你可以用这个模式来自己给 DeepSeek Harness 来写插件,自己来更新自己的 DSH 客户端。

咱们前面聊到 DSH 它上限高,很大一部分原因就在这里。

过去像 Claude Code、Codex 这类工具,通常都会先有一个比较完整的官方主体。

文章配图-1

通过这个主体,配置好了模型最基本的文件读取、代码修改、任务分配等等能力,大家虽然也能在这些软件上继续写插件改代码,但是项目整体的骨架已经定死了。

而 DeepSeek Harness 这里,则是一切都能改,一切功能都是插件,一切都被修改。

文章配图-1

举个例子,前面不是说了,这 DeepSeek V4 Pro 有四个工作模式嘛。

咱们现场就让它来再做个出第五个工作模式: “ 生存模式 ” 来看看效果。

只要简单的和它说出咱们的需求,DSH 就和过去一样的拆解问题,然后来自己实现问题。

文章配图-1

在经过了几轮调教后,咱们就得到了一个全新的生存模式。

文章配图-1

开启了生存模式后,DeepSeek Harness 不但在干活的时候会非常节省 Token,而且还会在界面的左下角,通过血条和法力值的方式,来显示当前项目的剩余 HP ( 上下文长度 ) 还有剩余的 MP ( 还有多少账户余额 )

当血条不够的时候还能自动提醒用户回血 ( 压缩上下文 ),蓝不够的时候也会提醒你要补魔 ( 充值 ) 了。

等到彻底没血没蓝,就说明是生存失败 G 了

文章配图-1

当然,差评君这只是小试牛刀玩了一下,实际上,在那堆内测大佬手里,DeepSeek Harness 已经被他们玩出花来了。

就比如有人直接做了一套鲸鱼娘的娘化皮肤。。。

文章配图-1

还有哥们整活,给自己做了套广告在上面。

https://github.com/Nagi-ovo/dsh-ads

文章配图-1

https://github.com/Anionex/dsh-vision-toolkit

文章配图-1

当然,这种一切都是插件,一切都能随意的安装,卸载组合的能力听起来很酷。

但做起来那是一点也不简单。

咱们平时电脑里删个软件都删不干净呢,而 DeepSeek 为了能把这么多插件的加载,卸载给搞明白,还花了不少心思研究。

DeepSeek 和北大特意还搓了篇论文出来,名叫《 时空可组合性的编程范式 》。

研究完我发现,DeepSeek 不只是为了酷,他们是想给 AI 定制个动态的操作系统。

文章配图-1

他们把矛头,直至一个现代软件的工程难题:到底怎样,才能让复杂的系统在运行时,可以安全、自由地拼装和拆卸。

在 AI 时代,这件事儿就显得更重要了,无论是 Agent 执行任务还是自进化过程中,一直熄火重启,谁也顶不住啊。

相当于是,在一辆汽车在高速公路上不能熄火的情况下,有啥办法能自由地改装、维修这辆车。 DeepSeek 在论文里,直接先用数学证明了,这件事情是能做到的。

其中一招是时间可组合性,相当于 AI 做的每一个动作,系统都在底层偷偷备好了一副逆操作,也就是后悔药。

如果模型发现自己刚刚调错了一个接口,它可以瞬间启动逆向操作,把修改的状态完美恢复到弄坏前的样子,不需要重启。

还有一招是空间可组合性,插件组件们就像插座和插头,A 如果声明自己需要组件 B 提供的电源。

系统会自动监控,一旦组件 B 就绪,系统就自动激活组件 A;一旦组件 B 准备被拔除,系统会自动先让依赖它的组件 A 优雅地停工,然后再真正撤销组件 B,让整个依赖网络的启停完全自动化。

总之这篇论文挺复杂的,差评君也只是看了个皮毛,感兴趣、神通广大的差友可以去研究研究。

文章配图-1

最后,回到现在到底是梁圣、是梁子、还是梁白开话题上。

不能否认,在 DeepSeek V4 Flash 正式版不仅白菜价,还原地变强的背景下。。。

这次的 V4 Pro 确实没给一些人,带来期待中的新模型智商暴涨。

包括特殊环境下的算力稀缺,也让 DeepSeek 没守住之前的白菜价。

文章配图-1

但说实话,无论是 R1 的横空出世,还是 V4 Flash 的 “ 只收电费钱 ”,包括这次的 DeepSeeK Harness,DeepSeek 一直在给大家制造惊喜。

或许这个永远充满变数的 DeepSeek、不按常理出牌的梁文锋,才是大家热衷于 “ 滑动变祖器 ” 梗的根本原因。

最后的最后,我也大胆预测一波,因为 DeepSeek Harness 的可玩性实在是太强了,估计市面上马上就会有各种样式,基于 DeepSeek Harness 的变种 Agent 出现。

说不定,曾用极致的开源和性价比,砸开了大模型普惠的大门的 DeepSeek,这次会用 Harness,硬生生把 AI 带进了 Agent 普惠的新时代。

来源:差评

本文来自网络,不代表博海拾贝立场,转载请注明出处:https://www.bohaishibei.com/post/111937/
关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
Telegram
返回顶部