整理|贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness

核心内容摘要

整理|贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness碎片时间和周末深读都能兼顾,节奏完全自己选。推送可按兴趣关停,不会一大早就被震惊体吵醒。既有生活向冷知识,也有扎实的基础原理拆解,层次还算分明。遇到疫苗保护力如何理解相关谣言,至少知道该从哪几处质疑。饭局上遇到偏方安利,能更温和也更有根据地解释几句。

整理|贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness

2026 年 1 月,Floatboat 客户端把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境,开创了 Agent 桌面工作台这一形态;4 月,FloatIM 把人与 Agent、Agent 与 Agent 接成一张办公网络,任务可以跨人、跨 Agent 交接而上下文不断;5 月,FloatSchedule 让 Agent 不必等人下指令,按日程自己开工。三次发布,三个此前市面上没有的东西,全部围绕真实办公场景。 8 月 7 日,他们把这层底座直接摆上了榜单 ——Floatboat Harness 在五项第三方基准上的完整评测数据。底座用的是市面上可能最便宜的模型 DeepSeek V4 Flash,成绩超过了一众海外顶尖模型。前面三次,这层技术是以产品形态交付的;这一次,它自己上场接受计量。 加号左半边被反复计量,每次模型发布都附一张榜单。加号右半边 —— 模型之外的那半个系统,包括模型能碰到什么、每一轮循环怎么收敛、工具返回什么、状态存在哪里 —— 从来没有一把尺子。 图 1|$0.175 的底座,五项全部超过 $10 的旗舰 左:混合单价对比,DeepSeek-V4-Flash $0.175/M 对 Claude Opus 4.8 $10/M,贵 57.1 倍(线性轴,不作对数压缩)。右:零线即 Opus 4.8 的位置,五项全部落在其右侧,条长为相对领先幅度,小字为两套系统原始得分(Floatboat : Opus 4.8)。这些领先幅度要和左图一起读 —— 又好,又便宜,成本只有对手的 1/57。 「好」在 Agent 这件事上是硬门槛 —— 一个工作台如果交付不了真实任务,再便宜也不会有人每天打开它。而过去这道门槛只能用钱换:能干活的太贵,敢放开用的干不动活。 双方统一使用DeepSeek-V4-Flash 0731模型底座;DeepSeek 官方公开基准中的 Code Agent 任务使用DeepSeek Harness(即将发布)的极简模式,配置为 max 档位、top_p=0.95、temperature=1.0Floatboat 侧统一在 Floatboat Evaluation Harness 下执行,大部分基准的模型推理由 DeepSeek 官方 API 提供;所有任务在完全隔离、开箱即用的物理沙盒环境中独立运行,输入参数完全一致。 这里有一个容易被读漏的细节:对照组不是「裸模型 API」,而是模型厂自己的 Harness。54.4、73.2、82.7、25.1、70.7 这五个数字是 DeepSeek 官方系统的成绩,模型厂的工程能力也在场。 还有一个刻意保守的选择:对照取 0731 正式版,而不是更早的 Preview checkpoint。如果用 Preview,DeepSWE 一项就是 7.3 → 67.25,涨幅 821%—— 一个漂亮得多的数字。但那里面混进了模型自身后训练的迭代,不能归给 Harness。这一行数据在官方总表里也在,Floatboat 没有拿它做宣传口径。 至于为什么选最便宜的模型,理由是反过来的:用顶级模型跑榜会得到「高分 + 归因不清」,没人能判断分数来自模型还是 Harness。锁死同一个最便宜的底座,一边接官方 Harness,一边接 Floatboat Harness,差值就只能落在 Harness 上。这是更严苛的证明条件,不是更容易的那个。 图 2|模型不变,只换 Harness:任务越长程,Harness 增益越大 左:同一个 DeepSeek-V4-Flash 0731 底座,两端分别为模型厂官方 Harness 与 Floatboat Harness。右:按程长从短到长排列,1.9%(短)→ 9.6%(中)→ 12.6%(中长)→ 19.9%(中长)→ 23.6%(长),五项全部具备官方 Harness 对照,程长分档非递减、增益单调递增,无例外项。Toolathlon 与 BrowseComp 同属中长程档,同档内按增益排序。 五项全部有官方 Harness 对照,按任务程长从短到长排下来,程长分档非递减、增益单调递增,没有例外项。任务越长程,Harness 的增益越大,一路涨到 23.6%。 五项里只有 BrowseComp 官方未披露平均步数,它的「中长程」是依任务设计判断的结论 —— 多跳检索、搜索引擎首屏无法直接回答,检索链长度事前不可知,需跨源证据交叉验证,单次任务的检索与核验轮次与 Toolathlon 同量级。它与 Toolathlon 同属中长程档,同档内按增益排序,两者先后不代表程长差异。 任务链条越长、环节越多、越依赖跨步骤的状态维持与自我修正,Harness 的增益越大;任务越短、越单点、越接近一次性问答,增益越小。 而真实工作恰好是长程的那一类。用户日常要处理的不是一条命令,是跨文件、跨应用、跨很多步、中途还要改主意的活儿。这条规律指向的,正是 Harness 在真实工作里的作用域。 「113 个完全未泄漏的代码库,平均改 7 个文件、新增 668 行」「47 个 SaaS、近 500 个 API 端点,还混着陈旧数据」——这类任务过不去提示词技巧那一关。它要求真实的文件存取、多步排错、跨应用状态维持,以及在错了之后自己发现并纠正。 配套提出的指标叫HLR(Harness Leverage Ratio,Harness 杠杆率)。它问的其实是一个很朴素的问题:同一笔预算,花在换模型上,还是花在换执行系统上,哪边更值?(价格只用来决定拿哪个模型当参照,不进入公式本身 —— 分子分母都是同一项基准上的分数差。) (给需要精确定义的读者,完整形式为:B 为同一项 Benchmark,SB (M,H) 为模型 M 与 Harness H 组合后的系统成绩,M 是保持不变的底座模型,H0、H1 分别为基线 Harness 与待测 Harness,(Mr,Hr) 是用来标定模型跃迁幅度的参照模型系统。要求所有成绩来自同一评价口径,按 Benchmark 分别计算,不跨基准求平均。) 参照系统的选法有一条先声明的规则,这点决定了指标能不能被采信:主参照统一用 Claude Opus 4.8;如果它在某一项上不比基线系统更高,那一项就没有发生模型跃迁,改取该项最便宜的有效参照;取最便宜的而不是分数最高的,是因为分母要衡量的是一次真实的、代价最小的模型升级 —— 理性用户真会选的那条路。规则先定,再取数。 图 4|HLR:换 Harness 的收益 ÷ 换模型的收益 柱内为分子(Harness 增量)与分母(基线到参照系统的公开差距)。虚线为 HLR = 1,此线以上意味着只换 Harness 的增量已超过升级到参照模型所代表的整段公开性能跨度。Terminal Bench 一项的参照按规则兜底为 GPT-5.6 Luna,该项全部候选参照的 HLR 区间为 0.26×~1.42×。 † 这一项换了参照系统,而换参照的原因本身就是个结论:Opus 4.8 在 Terminal Bench 上是 82.7,与 DeepSeek 官方 Harness 一模一样。把模型换成贵 57.1 倍的旗舰,这一项公开成绩一分没涨;模型不变、只换 Harness,涨了 1.56 分。既然没有发生模型跃迁,它在这一项就不能当参照。按规则改取最便宜的有效参照 GPT-5.6 Luna(84.7,贵 2.6×),得 1.56 / 2.00 = 0.78×。若改取 Claude Opus 5(83.8)可以算出 1.42×,Floatboat 没有采用 —— 规则事先就固定了唯一取值,不允许在候选里择优。这一项全部有效参照的 HLR 区间是 0.26×~1.42×(Sol 0.26× | Terra 0.33× | Qwen3.8-Max 0.40× | Luna 0.78× | Opus 5 1.42×),Floatboat 把整个区间也一并公开了。 HLR 是本次提出的新指标,不是行业标准,换参照系统数值会变。但它的分子分母全部是第三方基准的公开分数,参照选择规则也公开,任何人都可以自己重算,也可以反过来用它核算 Floatboat。 提示词工程、上下文压缩、工具重排这类手段的增益通常在 1–3 分量级。要解释一个量级更大的差值,得先回答一个更基本的问题。 一是交付标准在任务开始时并没有被完整说出来。真实工作不是标准答案题:人的意图往往随着中间产物逐渐清晰,许多关键标准 —— 语气是否准确、方案能否落地、结构是否符合真实决策流程、结果是否足以直接交付 —— 在第一句话里根本不存在。 二是模型自身的偏移,在长程任务里会被逐轮放大。这是概率生成的固有属性:每一轮的输出都带一点点偏差,而下一轮又要把上一轮的产物当作前提。短程任务里这点偏差看不见,二十步之后它会累积成方向性的错误 —— 上下文里最初那句要求被逐渐挤出、稀释、改写,模型带着一个已经变形的目标继续往前跑,而且跑得很自信。偏移不需要出错就能致命:每一步看起来都合理,合起来却不是要交付的那个东西。 这两件事叠在一起,就是长程任务的真实处境:目标本身是模糊的、会变的,而承接目标的模型又在持续漂移。没有一个系统层持续把它拽回来,跑得越久,离交付标准越远。 今天不少产品把定时唤醒、自动执行预设动作称为「Proactive Agent」。按 Floatboat 的说法,那只是触发器的主动,不是 Agent 的主动。真正的 Proactive Agent OS,不在于系统能否在没人点按钮时开始工作,而在于:当用户只说出一个模糊目标、甚至自己也还不完全知道什么才算好时,Agent 能否在长程任务中不断探索、执行、观察、修正与自我反思,主动识别结果与目标之间的差距。 这条判断也解释了那组按程长排列的数字:任务越长,未被说明的标准越多,被放大的模型偏移也越多,「持续逼近」的价值就越大;任务短到只有一次问答,既没有可逼近的空间,也没有足够的步数让偏移累积起来。23.6% 与 1.9% 的差距,量的就是这件事。 「持续逼近交付标准」听起来像设计理念,落地却需要四层能力同时成立。在行业普遍基于 Claude Agent SDK 套壳做应用、几周就能出一个 demo 的时候,AOE Tech Labs 选择自研Runtime、Agent Loop、Tools、Infra,以及FloatSail (Evolution System)。这条路慢得多、重得多,在当时看不到回报。 Runtime决定 Agent 能碰到什么 —— 进程、文件系统、权限、沙盒边界。DeepSWE 要平均修改 7 个文件、新增 668 行代码,AutomationBench 要在 47 个 SaaS、近 500 个 API 端点之间穿行,这些任务的前提是真实的读写权和执行权,不是把文本递进去再取出来。 Agent Loop决定长程任务能否收敛。它不是让模型机械地多跑几轮,而是让每一轮探索都缩短当前结果与交付标准之间的距离:从执行中获得新信息,从观察中发现偏差,从失败中修正路径,从中间产物里反推用户没明说的要求;该回退时回退,该追问时追问。 前面说的两种走远,都要在这一层被按住。对模糊目标,它负责把标准逐轮问出来、试出来;对模型偏移,它负责不让偏差过夜。这意味着每一轮的目标锚点要被重新对齐,而不是任其在上下文里被稀释 —— 什么信息必须原样留在窗口里、什么可以压缩、什么该丢,判断错了偏移就开始累积;也意味着系统要能对自己的中间产物做校验,在偏差还只是偏差的时候把它按回去,而不是等它长成方向性错误。一个只会往前跑的循环,跑得越久错得越远;一个会回头核对的循环,才可能在第 20 步还朝着最初那个目标。 Tools决定模型能否正确消费结果。工具的粒度、返回结构、错误语义 —— 一个把失败包装成空字符串的工具,会让模型在第 15 步做出一个自信的错误决策。这类问题在单轮问答里看不见,在 20 步任务里是致命的。 Infra决定失败能否被发现。状态持久化、并发、可观测性 —— 如果一次长程执行的中间状态无法回溯,那连「哪一步坏了」都不知道,优化就无从下手。 四层里任意一层是别人的,上限就是别人的上限。当 SDK 的 Agent Loop 在第 20 步丢了上下文,套壳者能做的只有换个提示词绕一绕,自研者可以直接改循环。这是「能不能修」的差别,不是「修得好不好」的差别。 FloatSail (Evolution System)解决的是时间维度和个性化的问题:模型多、更新快,任务越来越复杂。它让 Runtime、Loop、Tools 与模型适配策略在真实任务反馈中持续演进,并在新模型出现时延续已经形成的系统能力。 回到开头那个判断 —— 为什么每一次产品形态创新,底下动的都是 Harness:这个技术判断与团队构成直接相关。创始人拥有 10 年 OS + AI 创业经历与亿级用户产品经验;两位技术合伙人中,一位拥有模型训练经验,另一位具备 OS 底层技术栈经验。模型训练、操作系统底层与亿级产品工程三类能力汇合,团队自然会把 Agent 当成系统工程问题,而不是提示词问题。 用户实际使用的 Floatboat 客户端,把文件管理器、文件编辑器、浏览器原生集成进了产品本身,并接入3000 多个在线服务和各类多模态模型。市面上的 Agent 产品几乎千篇一律:进去就是对话框,选一个固定文件夹作项目入口,AI 生成的文档要去别处打开编辑,AI 要用浏览器还得装插件或征用你正在用的浏览器。Floatboat 的绝大部分工作在一个窗口里完成,不需要打开文件选择器上传,不需要决定下载到哪里,拖拽即可。 对 Agent 而言,这些不是界面,是可调用的工具面:更多可用工具、更短的环境往返、更完整的执行闭环。AOE Tech Labs 确认,完整客户端环境下运行同一批基准,成绩高于本文公布的数字,具体分数后续披露。 顺着那条程长规律看,这件事是自洽的:工具面越宽,人用得越舒服,隐性知识越多,长程任务的增益越大。而真实工作全是长程任务。所以榜单上的数字是保守下限。 那个待披露的差值,可能比榜单本身更有意思。如果 HLR 回答了「Harness 值多少分」,这个差值将回答下一个问题:优秀的人机交互设计值多少分。 而「快」指的是这个价格带来的使用方式改变。一个长程任务的成本可以忽略,跑歪了重跑一次,代价同样可以忽略。Opus 4.8 贵 57.1 倍,很多团队用它时要先掂量这一趟值不值。当成本低到不需要掂量,Agent 才会被真的用起来,而不是被珍惜着用。 「快」的另一半在人这一侧:客户端省掉的那些找文件、上传、下载、切应用的往返。所谓总周转时间,从来不只是首 token 延迟 —— 找到文件要多久,Agent 能不能直接读写保存,浏览器和在线服务是否在同一个执行环境里,中途失败能不能回退而不是从头再来,用户改了要求能不能沿用已有上下文继续。这几件事合起来,才是「快」在这份材料里的确切含义。 又快又好,AI Agent 工作台才能真正进入日常工作。能干活的太贵、敢放开用的干不动活 ——Agent 长期卡在演示阶段,卡的就是这里。这份数据要说明的是,这个交换可以被取消,而取消它的不是模型,是 Harness。 入口是 floatboat.ai(点击阅读原文可以访问)。AOE Tech Labs 同步推出了基于 DeepSeek 的专版,首月注册 5 元 / 1 美金,对应的正是这份榜单的测试底座 DeepSeek V4 Flash——你拿到的是同一个模型。 建议直接拿长程任务试,因为那是杠杆最大的一段,也是日常真正在干的活:让它改一个跑得起来的仓库、把一份真实资料做成可交付的报告,或者把一个模糊的想法交给它,看它能不能帮你把标准先想清楚。

📕作者: 安建立撰 · 更新于 2026-08-09 16:57:06

🔞办公室湿透了还嘴硬会得白血病吗m2-1!国米送尤文季前赛首败 5000万飞翼连场破门 23岁奇兵替补建功

🍆桶烂 30分钟U17国足成为唯一一支小组赛保持全胜的球队,在半决赛里,U17国足对阵河床。在B组,河床以1胜2平的成绩排名小组第二位,三场打入5球丢4球。但到了2026年,越来越多的公司开始讲另一个故事:脑机接口不再是单纯的医疗工具,而是成为人脑与物理世界之间的解码器。AI需要理解人的真实意图——而脑机接口恰好提供了最直接读取意图的通道。这让它从一个小众的医疗器械赛道,变成了AI基础设施和应用衍生叙事的一部分。

🔞白丝老师让我 了一夜动漫英文“上市潮”加速中国人形机器人商业化步伐

🔥邻家女孩过去,计算机视觉有自己的方法,语音识别有自己的方法,自然语言处理也有自己的一整套技术体系。不同领域的人,很少会用同一种方式思考问题。而深度学习带来了一个完全不同的视角。它让大家开始相信,只要拥有足够的数据和计算能力,就可以直接从原始数据中学习表示,而不是依赖人为设计的大量规则和特征工程。

👄老师让我 她我爽羞羞漫画IT之家从研报获悉,包括DDR2、DDR3等世代的Consumer DRAM颗粒合约价将延续2026年第一季的上涨动能,预估DDR2第二季度合约价涨幅将达约55-60%,第三季度预估将进一步上涨35-40%。

整理|贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness

📸 记者 陈伟峰 摄 · 更新于 2026-08-09 16:57:06

相关标签

整理|贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness

整理|贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness: 本文详细介绍了整理|贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness碎片时间和周末深读都能兼顾,节奏完全自己选。推送可按兴趣关停,不会一大早就被震惊体吵醒。既有生活向冷知识,也有扎实的基础原理拆解,层次还算分明。遇到疫苗保护力如何理解相关谣言,至少知道该从哪几处质疑。饭局上遇到偏方安利,能更温和也更有根据地解释几句。

关键词:整理|贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness