范凯说 AI · 周日晚聊 第33期:四天多款顶级模型轮番登场,日常干活到底该用哪套组合?

AI直播GPT-6-AstraAgent工作流DeepSeek

开场

大家好,欢迎来到《范凯说 AI · 周日晚聊》,今天是第 33 期。

这周 AI 圈子感觉像提前过年:四天之内,顶级模型轮番登场。周一 Anthropic 发布 Claude Fable 5.1,在各大评测榜上高居榜首;周二 Google 发布 Gemini 3.8 Flash,号称追上了最前沿的模型;周三 OpenAI 发布 GPT-6 Astra,官方称它是世界上最聪明、最对齐的模型。可惜我自己的 Claude 订阅账号已经被封了,所以 Fable 5.1 我没法第一时间上手。

今天除了聊这几个新模型,我更想分享的是我这周做的深度实测:不同工作流到底该配哪个模型、哪个 Agent。我的核心判断是——模型越来越强,Agent 对它的限制就应该越来越少。把这套组合想清楚,比追着新模型跑重要得多。

第一部分:本周 AI 新闻——顶级模型轮番登场

新闻一:Claude Fable 5.1(周一)

Anthropic 发布了 Fable 5.1,Fable 是目前最强的模型,5.1 又把它往上推了一档。它在各个评测榜单上现在是高居榜首的状态。因为我的 Claude 订阅账号被封了,没办法第一时间体验,只能看各家评测。

新闻二:Google Gemini 3.8 Flash(周二)

Google 的 Gemini 一直被我吐槽拉垮,但它最近的 Flash 系列发得很勤快,3.6、3.7、3.8 连续发布。3.8 Flash 号称屠榜,说已经追上了最前沿的模型。但也有说法认为它这个成绩是刷榜刷出来的——数据很好看,用起来不是那么回事,思考深度其实不够。

我专门做了个实测:大家都说 3.8 Flash 中文写作水平很高,我就拿自己常用的写作场景——几百到一千字左右的文章——给了同样的素材、同样的提示词,让它和 DeepSeek V4 Flash 各写一篇。结果 DeepSeek V4 Flash 写得更符合我的预期,文风严谨,完全符合我的要求;Gemini 3.8 Flash 写出来的东西我没法用,有点像写小说、写玄幻,飘得让人没法接受。

从这件事能看出来:一个模型好不好,一定要拿自己最常用的场景亲自去测,评测成绩好的,实际用起来不一定更好。

新闻三:OpenAI GPT-6 Astra(周三)

GPT-6 Astra 是这周最重磅的发布。它主打 Computer Use 电脑操作,官方原话是:你在电脑上能做的任何事情,Astra 都能替你做。各家评测也达到了一线水平,基本和 Claude Fable 5 同级。有评测博主说,Astra 那种"人狠话不多"的感觉回来了。

我自己也用了。我的用法是把它当编程架构师——架构设计、Code Review 都交给它,也用普通任务跑过。两个感受:

第一,费 token。我把 thinking 设成 medium,肉眼可见周限额的血条在往下掉,消耗很大、很贵。第二,速度不慢。以前用 Claude 或者 OpenAI 5 系会觉得慢,Astra 跟 5.6 速度差不多,没有更慢的感觉。它的思维深度和决策准确度确实达到了很精准的程度。

所以我的结论是:如果你不差钱,确实可以开始用 6.0 了。

补充观察:评测体系正在失去公信力

这周各家媒体对前沿模型各种追捧——GPT-6 Astra、Gemini 3.8 Flash、千问 3.8 Max、混元 4 Preview,各种评测体系都出来了。但说实话,现在的评测体系已经失去了公信力:Astra 发布之后,有评测直接翻车,OpenAI 又换了新的评测模型,数据又出现巨大差异;Gemini 3.8 Flash 也被质疑刷榜。

一个模型真正能不能用,和它的评测数据好不好,是完全两回事。新模型可以用,但真不用去追评测。

第二部分:三种工作流 × 模型 × Agent,最佳组合是什么

我这周的评测方法

这周我花了大量时间做深度评测。先说方法:我不测最顶级的模型——真正工作时大量消耗 token,你不可能拿顶级模型去干苦力。我测的是日常主力的"搬砖"模型,一共四个:GPT-5.6 Terra、DeepSeek V4 Flash、GLM 5.3 Flash、千问 3.8。几个没测的也说明一下:Kimi K3 基础设施不行,动不动就服务器过载,可用性很差,排除;混元这种属于二线,没必要测;Grok 等 4.7 出来再看。

Agent 我主要测了三个:Claude Code、Codex、Pi Agent。

四个模型、三个 Agent 可以组合出很多套方案。详细评测明天会发成一条横屏长视频,这里先讲结论,而且是一个一句话原则:

一个模型自身的能力越强大,你就应该越少去限制它。 模型越来越强,Agent 给它的 Harness、给它的控制就应该越来越轻。连 OpenAI 都在建议你重新审视原来写的一堆 Skill 和 Agents,尽量减少对模型的限制。直播间有同学说得更直白:围栏越多越傻,模型越强,围栏要越轻量级。

三个 Agent 的限制程度也不一样:Pi Agent 是限制最少的;Claude Code 加了很多控制;控制最严格的是 Codex——沙箱机制严密,规则最死板。

办公工作流:Pi Agent + 强模型(GPT)

办公工作流是我现在用得最多的一类,包括数据调研、知识库、写报告、联网检索、信息整合,甚至股票调研、金融信息整合,都算这一类。它的特点是给模型大量上下文,让它读文档、出数据报告、做决策。

办公工作流的最佳组合:Pi Agent + GPT。效果最差的是 Codex。

原因就是我上面说的原则:办公场景应该让模型充分发挥、尽可能去抓取数据、写报告时给出丰富细节,所以绝不能用一个限制死板的 Agent。用 Codex 写出来的报告非常干瘪——结论当然没错,但会缺失大量丰富细节,最后变成"正确的废话",你看着很难受。而 Pi Agent 不去限制模型,模型能充分发挥自己的能力,配 GPT 做办公工作流,细节丰富、结论准确,是最佳搭配。

创作工作流:Pi Agent + DeepSeek V4 Flash,再加一个"责任编辑"

先说模型:试了这么多模型,中文写作能力最强的有两个——DeepSeek V4 Flash 和 Claude Opus 4.6,没有别的能跟它们比。我现在 Claude 账号被封了,用不了 Opus 4.6,但 DeepSeek V4 Flash 完全可以平替它。GPT 的中文写作是渣中之渣,绝对不适合用在中文创作场景;GLM、千问跟 DeepSeek V4 Flash 比也是被秒的份。

再说 Agent:中文创作的最佳组合是 Pi Agent + DeepSeek V4 Flash。如果配 Codex,写出来还是干瘪;配 Claude Code 效果有明显提升,但从内容的丰富度和行文的活泼度看还是死板,AI 味儿浓。

不过 Pi + DeepSeek 也有它的问题:DeepSeek 写作很好,但会飘——写着写着容易跑题,而且写得很冗长。所以我的完整流程是这样的:

第一步,Pi Agent + DeepSeek 先写大纲,大纲定稿后,让 Pi Agent + GPT 审一遍大纲,看一致性好不好、有没有漂移;第二步,按审稿意见调整后开始写作;第三步,全文定稿前,再让"责任编辑"——还是 Pi Agent + GPT——全文审阅:有没有乱写、有没有漂移、有没有超级啰嗦;第四步,把意见返回给"作家"(Pi + DeepSeek)再写一遍。

所以最佳实践是:定大纲和全文定稿这两个环节,要调一个更强的模型来把关。写作本身用最松的 Pi Agent + 中文最强的 DeepSeek;审核用 Pi Agent + GPT(有 Claude Opus 4.6 也可以)。记住千万不要用 Codex 来写文章,也不要用在写作工作流——它会按编程场景给你框得太死。

关于 AI 味儿,我自己的体感:Codex 写出来干瘪到没法看;Claude Code 没那么干瘪但 AI 味儿重;换成 Pi Agent + DeepSeek,AI 味儿已经很淡,大约 15%;再加上你自己的语言风格提示词、去 AI 味提示词,能压到 10% 以内;最后自己手工改一遍,成品基本能控制在 5% 以内。

编程工作流:强 Agent Codex + 强模型 GPT

编程和写作、办公正好相反:代码场景约束越强越好,因为代码错一点点,整个程序逻辑就出问题。所以编程工作流最适合强模型 + 强 Agent,我用的是 Codex + GPT 模型。

推荐大家去看一个叫 Frontier Harness 的网站:它用同一个模型——Kimi K3——去测不同 Agent Harness 的代码通过率,专门测编程场景。结论:代码通过率最高的是 Codex;其次是 Claude Code 和 DASH Creator,差大约三个百分点;再往下是不做限制的 DeepSeek 标准版和 Pi Agent。也就是说,加了 Harness 之后对编程效果更好,而 Codex 这种极其严格的 Harness,编程通过率最高。

但它有个代价:token。Pi Agent 是最省 token 的,在省 token 和质量之间最均衡;Claude Code 只比 Pi 好一点点,消耗的 token 成本却是 Pi Agent 的七倍。Claude Code 搭自己的模型没问题,但搭别的模型不推荐——太耗 token。

把三种工作流串起来:Paseo 里的五个角色

那么问题来了:三种工作流怎么混着用?比如我从办公工作流开始讨论,聊着聊着发现要改代码,怎么办?这就需要一个能把不同 Agent + 不同模型组合在一起编排的工具——我用的就是 Paseo。

我在 Paseo 里配了五个角色,每个角色是"一个 Agent + 一个模型 + 一种用途"的固定组合:

  • 作家:Pi Agent + DeepSeek V4 Flash,thinking 设 High,最适合新媒体创作;
  • 程序员:Codex + GPT-5.6 Sol,设 High,主力写代码;
  • 架构师:Codex + GPT-6 Astra,设 Medium——最强模型加最严 Harness,负责架构设计和审核,Medium 省一点 token;
  • 决策:Pi Agent + GPT-5.6 Sol,负责日常工作中的重要决策;
  • 搬砖:Pi Agent + GPT-5.6 Terra,设 Medium,负责查新闻、知识库管理、文档处理、数据调研这类日常普通工作。

用法很简单:我在搬砖(Pi + GPT-5.6 Terra)的会话里整理个人付费网站的产品策略,聊完发现需要改代码,就跟它说:把这个任务整理好,交由架构师审方案,方案通过后让程序员写代码,写完架构师做 Code Review,通过后本地测试、Preview 环境测试、再走生产环境。它会自动编排:调架构师做设计、转给程序员写代码、再让架构师 Review。

我现场演示的时候,架构师正在做第二轮 Code Review,结论是"第二轮 Code Review 不通过,必须返工,禁止进入 Preview",然后任务被丢回程序员,已经改了二十一分三十八秒。一个主 Agent 负责调度,指挥一个架构师、一个程序员吭哧吭哧干活,这个过程是全自动的。

所以 Paseo 之所以是神器,因为它是一个第三方多 Agent 编排框架:Claude Code 只能编排自己的 Claude Code,Codex 的编排也只能用 Codex 自己的模型——它们都只能编排自家的 Agent、自家的模型。只有第三方的编排,才能充分利用"Agent × 模型"的任意组合。同时它还给你所有 Agent 的 CLI 装上了 GUI,支持手机、Pad、笔记本多端远程遥控同一台电脑上的所有 Agent,还内置远程终端和远程代码编辑器。

一句话总结

在现在的时代,哪怕国产的 DeepSeek V4 Flash、GLM 5.3 Flash,其实已经足够完成你的办公工作流和创作工作流了;编程你可能还是要用 GPT。但对我们大多数人来说,真正该花心思的不是追最新最强的模型,而是想清楚:你有哪些工作场景?每个场景配置哪些角色?角色之间是什么协作关系?怎么把它们有机编排起来?当这些想清楚之后,你只要发起一个命令,多 Agent 就开始自己协作干活了。

这才是我们作为 OPC(一人公司)、作为超级个体,真正应该具备的能力。

用户答疑精选

模型选择的总答案:国产 DeepSeek 主力 + GLM 辅助,海外 GPT 主力 + Grok 备选

有人问手头是 M1 Max 64G、要不要用千问 3.8 Flash Next。我的看法是:千问模型很拉垮——一线国产模型里,DeepSeek、GLM、千问、Kimi 这四个我都测来测去,千问真的很会刷榜,而且本地量化模型不稳定,不能作为主要考虑。Kimi 最大的问题是模型太大、基础设施太烂,用 Kimi K3 跑复杂任务经常跑到一半告诉你服务器过载,很恶心。

一家 AI 模型公司的能力,不光体现在训模型和刷榜的能力,更要体现在推理服务的稳定性上。DeepSeek 的推理服务稳定性极强,尤其 DeepSeek V4 Flash,跑起来每秒能到 150 个 token,又快又稳。

所以国产模型里真正能掰手腕的就两个:DeepSeek 和 GLM。MiniMax、小米 MiMo 都算二线。有同学问 GLM 5.3 Flash 是不是已经到了“斩杀线”?对,我认为确实是斩杀线,GLM 5.3 Flash 能力在线。

我的选择:国产主力 DeepSeek、备选 GLM;海外主力 GPT、备选 Grok。至于为什么不用 Claude——我的订阅账号被封了,不想天天跟它捉迷藏去折腾。

关于 Grok 多说两句:我没买 SuperGrok,流量套餐太少,跑不了重度任务,也不想每个月花 30 美元。我现在让它每天去抓 X 上的内容,给我生成一份每日 X 日报——Grok 能默认用 X.com 自己的接口,抓数据很方便。马斯克自己也承认,Grok 4.6 还没达到 GPT 和 Claude 的水平,要等 4.7 出来才行;既然它还没上牌桌,我也不急着测它,等 4.7 出来再说。

本地部署:128G 机器上最强的是 DeepSeek V4 Flash 2.4 比特

本地部署 27B BF16 能力会更强吗?不会。我明确测过:在我 128G 的 Mac Studio 上,能力最强的就是 DeepSeek V4 Flash 2.4 比特量化版,能控制在 90G 内存左右。27B 的速度并不会更快,能力会弱很多很多。它显著好于千问 3.8 FlashNext——FlashNext 的 Q3、Q4E 量化我测过,context 大了或者任务复杂了就会抖动、不稳定。玩玩可以,真要在本地干活,模型稳定性很重要,而 DeepSeek V4 的本地模型非常非常稳定。

有人下单了 96G 的 M5 Ultra 想跑 2.4 比特的 DeepSeek V4 Flash——没希望。这个模型 86GB,整个跑起来至少要准备 90G 内存,96G 会频繁交换。建议用小一点的模型,或者你上 256G 的 Mac,跑 Q4 量化版,那本地就绝对无敌了。

Mac 上最好用的本地推理框架就是 oMLX,装上去直接在页面里下载模型就能跑。

顾问模式的经验与坑

做顾问最重要的是:不要变成一个乙方、一个外包的乙方。你还是得有一套自己的、完整的、成体系的经验。你到底是帮客户做什么的?做咨询的——你根据客户的情况给他做咨询,最终是他得按照你的套路来,不能是你按照他的套路来;你按照他的套路来,你就是外包、你就是乙方。所谓咨询,就是你给客户提供方案,客户认可这个方案、按照你的方案来,你这个顾问才做得下去。

有人问 Agent 工作流里的顾问模式,比如强模型规划、轻模型执行、循环迭代,行不行?没问题。因为主 Agent 其实只负责调度,当模型本身足够强的时候,子 Agent 来回调度没有任何瓶颈。我默认就是 Pi Agent + GPT-5.6 Terra,thinking 设 medium 或 high——thinking 级别无所谓,随时可以改。比如我在搬砖会话里聊着聊着想到一个选题,就说"进入创作模式,让作家去写大纲",搬砖者本身就是 5.6 Terra,它去调度几个子 Agent 不存在任何瓶颈。

办公自动化:Outlook 邮件 + 多表 Excel 查询

这种场景特别适合 Pi Agent + GPT-5.6:GPT-5.6 处理得比较稳,Pi Agent 不怎么限制它。具体做法:邮件在 Chrome 浏览器里,可以让 Pi Agent 通过 CDP 这个 MCP 直接控制 Chrome 浏览器;Excel 要本地查询,就让 Pi 用本地的 CLI 去读——Homebrew 装一个能读表格的工具就行。如果一定要用 Computer Use 操纵桌面软件,那就只能用 Codex 桌面端,让它直接操纵 Excel 表格和 Outlook 邮件。顺带说一句,Pi 连接飞书也不难:飞书有 CLI,你把飞书 CLI 丢给 Pi,让它直接调用就行。

怎么保证 AI 写的代码"有效",而不是"逻辑正确但没法用"

靠多 Agent:一个 Agent 写代码,一个 Agent 去审核。更重要的是用测试去覆盖,我现在认为最重要的是端到端测试,总共三层:第一层单元测试,TDD,先写测试再写功能代码;第二层集成测试,功能文档里定义的整个工作流要有一个集成测试;第三层端到端测试,你作为一个用户实际使用产品的完整流程——注册流程、支付流程——全部定义成文档。

把这三份文档(单元测试、集成测试、端到端测试)把关好,你就不用去看代码了:三个测试全通过,代码再烂它也是 work 的。Web 端好办,Agent 可以控制浏览器跑本地和远端的端到端测试——本地搭测试环境,远端搭 Preview 预发布环境(支付流程在本地跑不了),生产环境不能跑支付测试。桌面软件和 iOS 这种就得上 Computer Use,我的做法是定义一个"本地测试验收专家",直接让它去调 Codex 的 Computer Use 就行。这套搭完,我敢说 95% 以上是 OK 的,管代码质量没有任何意义了。

Pi Agent 最少装哪几个插件?

我认为只需要一个必装的:MCP。因为 Pi Agent 要用 Paseo 的多 Agent 编排,需要调用 Paseo 的 MCP;要控制 Chrome 做端到端测试和前端开发,装 CDP 这个 MCP,对 Chrome 有最丰富的控制。我实际装了三个:MCP、Web Access(做联网搜索和数据调研)、Pi Memory(记录你的习惯用法,省得反复提醒,可装可不装)。三个足够了,不需要第四个。Pi 这种简单 Agent 的理念就是少控制、少装东西,真正需要的能力自己写 skill、写扩展。

补充两个具体问题的答案:做数据分析用 Pi Agent,千万别用 Codex——Codex 写数据报告不给你任何细节,全是正确的废话,能把你恶心吐了;产品要快速上线、线上收款,用 Stripe,注册个账号拿一个 token,接入代码交给 Agent 写就行,全球支付现在标准就是 Stripe。

用 Paseo 是不是要写很多说明文档?要不要装 CC Switch?

不用写说明文档。Paseo 自带六到七个 skill,你的 Agent 能读到这些 skill,你只要定义好角色、说出角色名,剩下它全给你搞定。

CC Switch 只是修改 Claude Code 和 Codex 的配置文件;Paseo 读的是 Claude Code 和 Codex 的 CLI,所以两者不是冲突关系——你用 CC Switch 改过的配置,Paseo 读到的就是改过的版本。至于让 Paseo 去接 DSH(DeepSeek Harness),我没有任何兴趣:DSH 还在剧烈变动中,接口很不稳定,玩玩可以,不适合做主力,目前不在我的射程范围之内。

家里和办公室怎么协同用 Paseo?

你只需要一套工作环境。我的做法:所有 Agent 工具都装在家里那台 Mac Studio 工作站上,Paseo 也装在那,它一起来就是守护进程,本机起一个服务端口;然后笔记本、手机、Pad 都装 Paseo,扫码跟工作站绑定。绑定之后,手机、Pad、笔记本用的其实都是工作站上那套 Paseo——局域网内要打开一下权限才能直连,正常情况下走中继服务器,很安全。所以你在办公室的台式机装好 Paseo,回家用手机、笔记本操作的都是办公室那台电脑,等于只有一套开发环境,但走到哪儿都能无缝远程使用。

写作 AI 味儿太重怎么办?

记住用 Pi Agent——用一个不去限制模型的 Agent。Claude Code 逻辑确实比 Pi 强,但对文章来说,它的 Harness 会限制文风,不够活泼、没人味儿,AI 味儿会越来越重。具体到我的工作流:作家是 Pi Agent + DeepSeek V4 Flash,责任编辑是 Pi Agent + GPT,按这个流程跑一遍,写出来的文章文采斐然、没什么 AI 味,最后自己手工看一遍稍微改改就行。大纲和全文定稿时调一个更强的模型来把漂移和啰嗦关。

用 Hermes 怎么样?

Hermes 两边不靠:要么像 Codex 这种强 Agent 用编程场景,要么像 Pi Agent 这样尽量少限制、充分发挥模型能力。它宣传的自进化能力,我在 Pi 里用 Pi Memory 加自己写 extension、写 skill 也能实现,控制力还更强,所以 Hermes 对我不算有价值。不过我自己给 Hermes 搭过一个环境,拿微信做了远程登录,给家里小孩做问答用——它有记忆能力,给孩子用还挺合适。

做 PPT 用什么模型和 Skill?

取决于你有哪些 Skill 和扩展。Codex 目前有比较好的 PPT 扩展,但它从创作角度不合适。我的两种做法:一是先用 Pi Agent + GPT 完成 slide 内容的创作,再把结果 hand off 给 Codex + GPT 生成 PPT——Codex 生成 PPT 很强,多 Agent 编排能无缝完成这种交接;二是纯用 Pi Agent + GPT:先生成每页内容并定稿,再转成 HTML 页面做美化,最后调 Chrome 的打印功能输出 PDF。不是非要动画的话,PDF 展示就够了,第二种更灵活,基本不依赖第三方插件。架构图更简单,Markdown 本身就支持。

写在最后

不要天天盯着哪个模型强、哪个模型弱。一开始玩一玩可以,但慢慢地,你要形成自己的一整套多 Agent 工作流编排框架,那才真正提高你的工作效率。我现在已经开始形成自己的这套工作流了,跑起来挺好。

下周日晚九点,我们继续聊。


如果你希望把 AI 更系统地应用到工作、学习与个人成长中, 更多课程、教程和会员内容,请访问「范凯说AI」个人付费会员网站:

fankaishuo.ai