新闻 话题

贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness

焦雷森 阅读约 3 分钟 697745 阅读
贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness
配图:贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness

新闻导读

贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness查找体验意外地好,搜完相关条目会串成一条线,不再是散落的冷知识碎片。热点事件解读会标明哪些较确定、哪些仍在研究,表述相对克制。收藏、稍后读和笔记同步比较稳,复习旧内容不用重新翻半天。还想学的状态比被震惊一下健康太多。天文地理健康科技都有覆盖,单篇不长,信息密度却够用。后面会继续追专题,尤其是那些可迁移的硬核基础。

2026 年 1 月,Floatboat 客户端把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境,开创了 Agent 桌面工作台这一形态;4 月,FloatIM 把人与 Agent、Agent 与 Agent 接成一张办公网络,任务可以跨人、跨 Agent 交接而上下文不断;5 月,FloatSchedule 让 Agent 不必等人下指令,按日程自己开工。三次发布,三个此前市面上没有的东西,全部围绕真实办公场景。 8 月 7 日,他们把这层底座直接摆上了榜单 ——Floatboat Harness 在五项第三方基准上的完整评测数据。底座用的是市面上可能最便宜的模型 DeepSeek V4 Flash,成绩超过了一众海外顶尖模型。前面三次,这层技术是以产品形态交付的;这一次,它自己上场接受计量。 加号左半边被反复计量,每次模型发布都附一张榜单。加号右半边 —— 模型之外的那半个系统,包括模型能碰到什么、每一轮循环怎么收敛、工具返回什么、状态存在哪里 —— 从来没有一把尺子。 图 1|$0.175 的底座,五项全部超过 $10 的旗舰 左:混合单价对比,DeepSeek-V4-Flash $0.175/M 对 Claude Opus 4.8 $10/M,贵 57.1 倍(线性轴,不作对数压缩)。右:零线即 Opus 4.8 的位置,五项全部落在其右侧,条长为相对领先幅度,小字为两套系统原始得分(Floatboat : Opus 4.8)。这些领先幅度要和左图一起读 —— 又好,又便宜,成本只有对手的 1/57。 「好」在 Agent 这件事上是硬门槛 —— 一个工作台如果交付不了真实任务,再便宜也不会有人每天打开它。而过去这道门槛只能用钱换:能干活的太贵,敢放开用的干不动活。 双方统一使用DeepSeek-V4-Flash 0731模型底座;DeepSeek 官方公开基准中的 Code Agent 任务使用DeepSeek Harness(即将发布)的极简模式,配置为 max 档位、top_p=0.95、temperature=1.0Floatboat 侧统一在 Floatboat Evaluation Harness 下执行,大部分基准的模型推理由 DeepSeek 官方 API 提供;所有任务在完全隔离、开箱即用的物理沙盒环境中独立运行,输入参数完全一致。 这里有一个容易被读漏的细节:对照组不是「裸模型 API」,而是模型厂自己的 Harness。54.4、73.2、82.7、25.1、70.7 这五个数字是 DeepSeek 官方系统的成绩,模型厂的工程能力也在场。 还有一个刻意保守的选择:对照取 0731 正式版,而不是更早的 Preview checkpoint。如果用 Preview,DeepSWE 一项就是 7.3 → 67.25,涨幅 821%—— 一个漂亮得多的数字。但那里面混进了模型自身后训练的迭代,不能归给 Harness。这一行数据在官方总表里也在,Floatboat 没有拿它做宣传口径。 至于为什么选最便宜的模型,理由是反过来的:用顶级模型跑榜会得到「高分 + 归因不清」,没人能判断分数来自模型还是 Harness。锁死同一个最便宜的底座,一边接官方 Harness,一边接 Floatboat Harness,差值就只能落在 Harness 上。这是更严苛的证明条件,不是更容易的那个。 图 2|模型不变,只换 Harness:任务越长程,Harness 增益越大 左:同一个 DeepSeek-V4-Flash 0731 底座,两端分别为模型厂官方 Harness 与 Floatboat Harness。右:按程长从短到长排列,1.9%(短)→ 9.6%(中)→ 12.6%(中长)→ 19.9%(中长)→ 23.6%(长),五项全部具备官方 Harness 对照,程长分档非递减、增益单调递增,无例外项。Toolathlon 与 BrowseComp 同属中长程档,同档内按增益排序。 五项全部有官方 Harness 对照,按任务程长从短到长排下来,程长分档非递减、增益单调递增,没有例外项。任务越长程,Harness 的增益越大,一路涨到 23.6%。 五项里只有 BrowseComp 官方未披露平均步数,它的「中长程」是依任务设计判断的结论 —— 多跳检索、搜索引擎首屏无法直接回答,检索链长度事前不可知,需跨源证据交叉验证,单次任务的检索与核验轮次与 Toolathlon 同量级。它与 Toolathlon 同属中长程档,同档内按增益排序,两者先后不代表程长差异。 任务链条越长、环节越多、越依赖跨步骤的状态维持与自我修正,Harness 的增益越大;任务越短、越单点、越接近一次性问答,增益越小。 而真实工作恰好是长程的那一类。用户日常要处理的不是一条命令,是跨文件、跨应用、跨很多步、中途还要改主意的活儿。这条规律指向的,正是 Harness 在真实工作里的作用域。 「113 个完全未泄漏的代码库,平均改 7 个文件、新增 668 行」「47 个 SaaS、近 500 个 API 端点,还混着陈旧数据」——这类任务过不去提示词技巧那一关。它要求真实的文件存取、多步排错、跨应用状态维持,以及在错了之后自己发现并纠正。 配套提出的指标叫HLR(Harness Leverage Ratio,Harness 杠杆率)。它问的其实是一个很朴素的问题:同一笔预算,花在换模型上,还是花在换执行系统上,哪边更值?(价格只用来决定拿哪个模型当参照,不进入公式本身 —— 分子分母都是同一项基准上的分数差。) (给需要精确定义的读者,完整形式为:B 为同一项 Benchmark,SB (M,H) 为模型 M 与 Harness H 组合后的系统成绩,M 是保持不变的底座模型,H0、H1 分别为基线 Harness 与待测 Harness,(Mr,Hr) 是用来标定模型跃迁幅度的参照模型系统。要求所有成绩来自同一评价口径,按 Benchmark 分别计算,不跨基准求平均。) 参照系统的选法有一条先声明的规则,这点决定了指标能不能被采信:主参照统一用 Claude Opus 4.8;如果它在某一项上不比基线系统更高,那一项就没有发生模型跃迁,改取该项最便宜的有效参照;取最便宜的而不是分数最高的,是因为分母要衡量的是一次真实的、代价最小的模型升级 —— 理性用户真会选的那条路。规则先定,再取数。 图 4|HLR:换 Harness 的收益 ÷ 换模型的收益 柱内为分子(Harness 增量)与分母(基线到参照系统的公开差距)。虚线为 HLR = 1,此线以上意味着只换 Harness 的增量已超过升级到参照模型所代表的整段公开性能跨度。Terminal Bench 一项的参照按规则兜底为 GPT-5.6 Luna,该项全部候选参照的 HLR 区间为 0.26×~1.42×。 † 这一项换了参照系统,而换参照的原因本身就是个结论:Opus 4.8 在 Terminal Bench 上是 82.7,与 DeepSeek 官方 Harness 一模一样。把模型换成贵 57.1 倍的旗舰,这一项公开成绩一分没涨;模型不变、只换 Harness,涨了 1.56 分。既然没有发生模型跃迁,它在这一项就不能当参照。按规则改取最便宜的有效参照 GPT-5.6 Luna(84.7,贵 2.6×),得 1.56 / 2.00 = 0.78×。若改取 Claude Opus 5(83.8)可以算出 1.42×,Floatboat 没有采用 —— 规则事先就固定了唯一取值,不允许在候选里择优。这一项全部有效参照的 HLR 区间是 0.26×~1.42×(Sol 0.26× | Terra 0.33× | Qwen3.8-Max 0.40× | Luna 0.78× | Opus 5 1.42×),Floatboat 把整个区间也一并公开了。 HLR 是本次提出的新指标,不是行业标准,换参照系统数值会变。但它的分子分母全部是第三方基准的公开分数,参照选择规则也公开,任何人都可以自己重算,也可以反过来用它核算 Floatboat。 提示词工程、上下文压缩、工具重排这类手段的增益通常在 1–3 分量级。要解释一个量级更大的差值,得先回答一个更基本的问题。 一是交付标准在任务开始时并没有被完整说出来。真实工作不是标准答案题:人的意图往往随着中间产物逐渐清晰,许多关键标准 —— 语气是否准确、方案能否落地、结构是否符合真实决策流程、结果是否足以直接交付 —— 在第一句话里根本不存在。 二是模型自身的偏移,在长程任务里会被逐轮放大。这是概率生成的固有属性:每一轮的输出都带一点点偏差,而下一轮又要把上一轮的产物当作前提。短程任务里这点偏差看不见,二十步之后它会累积成方向性的错误 —— 上下文里最初那句要求被逐渐挤出、稀释、改写,模型带着一个已经变形的目标继续往前跑,而且跑得很自信。偏移不需要出错就能致命:每一步看起来都合理,合起来却不是要交付的那个东西。 这两件事叠在一起,就是长程任务的真实处境:目标本身是模糊的、会变的,而承接目标的模型又在持续漂移。没有一个系统层持续把它拽回来,跑得越久,离交付标准越远。 今天不少产品把定时唤醒、自动执行预设动作称为「Proactive Agent」。按 Floatboat 的说法,那只是触发器的主动,不是 Agent 的主动。真正的 Proactive Agent OS,不在于系统能否在没人点按钮时开始工作,而在于:当用户只说出一个模糊目标、甚至自己也还不完全知道什么才算好时,Agent 能否在长程任务中不断探索、执行、观察、修正与自我反思,主动识别结果与目标之间的差距。 这条判断也解释了那组按程长排列的数字:任务越长,未被说明的标准越多,被放大的模型偏移也越多,「持续逼近」的价值就越大;任务短到只有一次问答,既没有可逼近的空间,也没有足够的步数让偏移累积起来。23.6% 与 1.9% 的差距,量的就是这件事。 「持续逼近交付标准」听起来像设计理念,落地却需要四层能力同时成立。在行业普遍基于 Claude Agent SDK 套壳做应用、几周就能出一个 demo 的时候,AOE Tech Labs 选择自研Runtime、Agent Loop、Tools、Infra,以及FloatSail (Evolution System)。这条路慢得多、重得多,在当时看不到回报。 Runtime决定 Agent 能碰到什么 —— 进程、文件系统、权限、沙盒边界。DeepSWE 要平均修改 7 个文件、新增 668 行代码,AutomationBench 要在 47 个 SaaS、近 500 个 API 端点之间穿行,这些任务的前提是真实的读写权和执行权,不是把文本递进去再取出来。 Agent Loop决定长程任务能否收敛。它不是让模型机械地多跑几轮,而是让每一轮探索都缩短当前结果与交付标准之间的距离:从执行中获得新信息,从观察中发现偏差,从失败中修正路径,从中间产物里反推用户没明说的要求;该回退时回退,该追问时追问。 前面说的两种走远,都要在这一层被按住。对模糊目标,它负责把标准逐轮问出来、试出来;对模型偏移,它负责不让偏差过夜。这意味着每一轮的目标锚点要被重新对齐,而不是任其在上下文里被稀释 —— 什么信息必须原样留在窗口里、什么可以压缩、什么该丢,判断错了偏移就开始累积;也意味着系统要能对自己的中间产物做校验,在偏差还只是偏差的时候把它按回去,而不是等它长成方向性错误。一个只会往前跑的循环,跑得越久错得越远;一个会回头核对的循环,才可能在第 20 步还朝着最初那个目标。 Tools决定模型能否正确消费结果。工具的粒度、返回结构、错误语义 —— 一个把失败包装成空字符串的工具,会让模型在第 15 步做出一个自信的错误决策。这类问题在单轮问答里看不见,在 20 步任务里是致命的。 Infra决定失败能否被发现。状态持久化、并发、可观测性 —— 如果一次长程执行的中间状态无法回溯,那连「哪一步坏了」都不知道,优化就无从下手。 四层里任意一层是别人的,上限就是别人的上限。当 SDK 的 Agent Loop 在第 20 步丢了上下文,套壳者能做的只有换个提示词绕一绕,自研者可以直接改循环。这是「能不能修」的差别,不是「修得好不好」的差别。 FloatSail (Evolution System)解决的是时间维度和个性化的问题:模型多、更新快,任务越来越复杂。它让 Runtime、Loop、Tools 与模型适配策略在真实任务反馈中持续演进,并在新模型出现时延续已经形成的系统能力。 回到开头那个判断 —— 为什么每一次产品形态创新,底下动的都是 Harness:这个技术判断与团队构成直接相关。创始人拥有 10 年 OS + AI 创业经历与亿级用户产品经验;两位技术合伙人中,一位拥有模型训练经验,另一位具备 OS 底层技术栈经验。模型训练、操作系统底层与亿级产品工程三类能力汇合,团队自然会把 Agent 当成系统工程问题,而不是提示词问题。 用户实际使用的 Floatboat 客户端,把文件管理器、文件编辑器、浏览器原生集成进了产品本身,并接入3000 多个在线服务和各类多模态模型。市面上的 Agent 产品几乎千篇一律:进去就是对话框,选一个固定文件夹作项目入口,AI 生成的文档要去别处打开编辑,AI 要用浏览器还得装插件或征用你正在用的浏览器。Floatboat 的绝大部分工作在一个窗口里完成,不需要打开文件选择器上传,不需要决定下载到哪里,拖拽即可。 对 Agent 而言,这些不是界面,是可调用的工具面:更多可用工具、更短的环境往返、更完整的执行闭环。AOE Tech Labs 确认,完整客户端环境下运行同一批基准,成绩高于本文公布的数字,具体分数后续披露。 顺着那条程长规律看,这件事是自洽的:工具面越宽,人用得越舒服,隐性知识越多,长程任务的增益越大。而真实工作全是长程任务。所以榜单上的数字是保守下限。 那个待披露的差值,可能比榜单本身更有意思。如果 HLR 回答了「Harness 值多少分」,这个差值将回答下一个问题:优秀的人机交互设计值多少分。 而「快」指的是这个价格带来的使用方式改变。一个长程任务的成本可以忽略,跑歪了重跑一次,代价同样可以忽略。Opus 4.8 贵 57.1 倍,很多团队用它时要先掂量这一趟值不值。当成本低到不需要掂量,Agent 才会被真的用起来,而不是被珍惜着用。 「快」的另一半在人这一侧:客户端省掉的那些找文件、上传、下载、切应用的往返。所谓总周转时间,从来不只是首 token 延迟 —— 找到文件要多久,Agent 能不能直接读写保存,浏览器和在线服务是否在同一个执行环境里,中途失败能不能回退而不是从头再来,用户改了要求能不能沿用已有上下文继续。这几件事合起来,才是「快」在这份材料里的确切含义。 又快又好,AI Agent 工作台才能真正进入日常工作。能干活的太贵、敢放开用的干不动活 ——Agent 长期卡在演示阶段,卡的就是这里。这份数据要说明的是,这个交换可以被取消,而取消它的不是模型,是 Harness。 入口是 floatboat.ai(点击阅读原文可以访问)。AOE Tech Labs 同步推出了基于 DeepSeek 的专版,首月注册 5 元 / 1 美金,对应的正是这份榜单的测试底座 DeepSeek V4 Flash——你拿到的是同一个模型。 建议直接拿长程任务试,因为那是杠杆最大的一段,也是日常真正在干的活:让它改一个跑得起来的仓库、把一份真实资料做成可交付的报告,或者把一个模糊的想法交给它,看它能不能帮你把标准先想清楚。

相关标签

免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:/?story/2026/08/09/k4w5hjf8ew.shtml

评论区

热门讨论 · 占位展示
说说你的看法…
发表评论
  • 用户
    读者7号
    朋友推荐时说“不鸡汤也不故弄玄虚”,体验后果然如此。会区分科普简化模型和专业表述,提醒别过度脑补。遇到平均数可能藏着什么陷阱相关谣言,至少知道该从哪几处质疑。进度跨设备衔接自然,换手机平板继续看不费劲。科学叙述尽量接得住更多人的生活,而不是只写给同温层。
    20260809 · 来自移动端
  • 用户
    李瑞君
    公式尽量兼顾可读描述,细节显得专业,也更有普惠感。图示和类比都挺到位,读完往往能记住核心观点,而不是只剩“好神奇”。像个靠谱的知识邻居,有事就问,问完不尴尬。家庭共享和分龄内容池让人更放心,给孩子用也踏实一些。作为主力科普入口长期留下很合适。
    2026-08-09 14:57:18
  • 用户
    热心网友
    黄色录像,内容值得关注,期待后续更新。
    20260809

期待你的精彩发言。