Claude Opus 5.5上线:价格降了四成,Anthropic更想证明“长任务不会跑偏”
CoinMeta
55分钟前
Ai 焦点
Anthropic在9月22日发布Claude Opus 5.5,这是Claude 5.5系列首个模型。公司给出的核心卖点很直接:多数工作上达到Claude Fable 5.1的水平,相比上一代Opus 5运行成本降低40%。但这次发布真正值得看的,不只是价格和榜单,而是Anthropic把测试重点进一步推向长时间任务、难以逆转的操作以及提示注入防护。
有帮助
No.帮助

Anthropic在9月22日发布Claude Opus 5.5,这是Claude 5.5系列首个模型。公司给出的核心卖点很直接:多数工作上达到Claude Fable 5.1的水平,相比上一代Opus 5运行成本降低40%。但这次发布真正值得看的,不只是价格和榜单,而是Anthropic把测试重点进一步推向长时间任务、难以逆转的操作以及提示注入防护。

官方称,Opus 5.5在复杂编码、研究和专业知识工作上有明显提升。早期测试者中,有团队用它在不到一天内完成约68万行代码迁移;Anthropic也强调模型可以保持更长的上下文和计划连续性。案例能说明能力上限,却不能被当成所有项目的平均交付时间。代码库结构、测试覆盖和人工审查都会改变结果。

降本不等于“便宜版旗舰”,而是重新划分模型使用边界

过去,Opus通常被留给最复杂、最昂贵的任务,日常工作更多交给速度更快的型号。Opus 5.5如果真能以较低成本接近Fable 5.1水平,企业就可能把旗舰模型用于更大批量的代码审查、文档分析和研究流程,而不只是在少数高价值请求上调用。

成本下降40%是Anthropic相对Opus 5的官方说法,不代表每家企业账单都会同步下降40%。实际费用取决于输入输出长度、缓存、工具调用次数和任务是否需要重试。更强模型也可能因为被赋予更长任务而消耗更多总Token。采购方需要用自己的工作负载测试“完成一项任务的总成本”,而不是只比较单位价格。

长任务能力同样要用完成质量衡量。一次大型代码迁移可能生成大量看似合理的改动,但真正成本包括回归测试、依赖冲突、部署和回滚。如果模型需要工程师花数天修复边缘问题,速度优势就会缩水。最有价值的评估应同时记录成功率、人工接管次数和不可逆错误,而不是只记录生成了多少代码。

Anthropic称Opus 5.5接受了Frontier Design、METR等外部评估者的发布前测试。外部参与能提高可信度,但不等同于所有报告、原始数据和测试环境都已完全公开。用户仍应区分公司自报结果、独立评估结果和自己环境中的复现结果。

安全测试开始盯住真实事故形态,而不只是短问答拒答率

Anthropic表示,Opus 5.5在其自动化行为审计中取得公司目前最好的成绩。测试覆盖数千个模拟情境,重点包括模型是否会采取难以撤销的动作、是否越过用户给定边界,以及面对提示注入时能否保持原任务。公司还把不可能完成的任务、持续时间更长的任务和基于真实事故设计的场景加入评估。

这是代理型AI走向生产环境后必须补的一课。传统安全测试常问模型会不会回答某类敏感问题,但能浏览网页、调用终端和修改文件的代理,风险更多来自行动链:它可能在错误前提下继续执行,也可能把网页里的恶意文字当作指令。一次错误点击或权限扩大,比一段不当回答更难挽回。

“更少越界”仍不等于“不会越界”。Anthropic明确承认模型存在限制。企业部署时仍需最小权限、操作确认、可追踪日志、沙箱和回滚机制。尤其是生产数据库、支付和基础设施变更,不应因为模型安全分数提升就取消人工批准。

这也是Anthropic提出“放慢前沿节奏”后的首个模型发布。公司试图传递的信号是:继续提升能力,同时把外部评估和更贴近真实事故的安全测试放进发布流程。不过,判断这一承诺能否成立,要看后续是否持续披露失败案例、测试方法和修复效果,而不是一次发布中的最高分。

对用户而言,Opus 5.5最值得测试的不是聊天回答是否更漂亮,而是它能否在数小时、多工具、多步骤的任务中保持约束,并在信息不足时停下来。模型市场的竞争正在从“谁答得更聪明”转向“谁能以可控成本把复杂工作做完”。价格下降让更多人有机会尝试,安全和工程纪律则决定这些尝试能不能真正进入生产。

企业在试用时可以建立一组简单但严格的对照:用同一批真实任务比较Opus 5、Opus 5.5和较低成本模型,记录完成时间、总费用、测试通过率、人工修改量和高风险动作次数。只有这些指标同时改善,升级才具有商业意义。发布日的演示适合发现可能性,连续数周的内部评测才适合决定权限和预算。

打赏
$0
点赞
0
收藏
0
浏览量 11
币界网提醒,请广大读者理性看待区块链,切实提高风险意识,警惕各类虚拟代币发行与炒作, 站内所有内容仅系市场信息或相关方观点,不构成任何形式投资建议。如发现站内内容含敏感信息,可点击“举报”,我们会及时处理。
提交
评论 0
最热
最新
还没有人评论哦~快抢沙发吧!
相关阅读
Binance向Circle投资1亿美元:五年合作瞄准USDC增量,不等于稳定币格局已经改写
Circle与Binance在9月22日宣布扩大合作:Binance对Circle进行1亿美元战略股权投资,双方签署新的五年商业协议,重点是在新兴市场推广、整合和扩大USDC使用。Circle将提供持有和使用USDC所需的基础设施服务,Binance则计划在其平台内加强USDC的曝光和产品接入。
币界网
·2026-09-23 09:56:08
23
Coinbase协助打掉EvilTokens:钓鱼工具开始用AI挑选“最值得骗的人”
Coinbase在9月22日披露,与执法和安全伙伴合作打掉名为EvilTokens的钓鱼即服务平台。它通过Telegram机器人出售整套攻击能力,包括邮箱收集、侦察、网页邮箱界面和AI自动化。运营者还计划把攻击范围扩大到Gmail和Okta账户。事件的危险之处不是又出现一套仿冒登录页,而是攻击者把入侵邮箱后的关系分析和付款目标筛选交给了AI。
币界网
·2026-09-23 09:54:52
24
加拿大7月跨境旅行继续分化:美国游客与海外游客,恢复节奏并不一样
加拿大统计局9月22日发布7月跨境旅行数据:加拿大居民从海外返回385.99万人次,同比增长6.9%;非居民访客入境458.46万人次,同比增长7.9%。经季节调整后,加拿大居民返回368.38万人次,环比下降0.3%;非居民入境262.83万人次,环比增长1.2%。暑期通常是全年高峰,因此同比和季调环比必须分开看。
币百科
·2026-09-23 09:53:50
14
英国8月借款183亿英镑:单月高于预测,债务率下降却不等于负担变轻
英国8月公共部门净借款达到183亿英镑,比去年同期增加29亿英镑,增幅19%,也比预算责任办公室预测高35亿英镑。英国国家统计局9月22日公布的数据同时显示,4月至8月财政年度累计借款为773亿英镑,比去年同期少22亿英镑,却仍高于官方预测81亿英镑。
币百科
·2026-09-23 09:52:50
14
Google用32种非洲语言做语音挑战:AI听懂Lingala和Shona,难点远不只缺数据
Google Research在9月22日公布WAXAL语音识别挑战结果。WAXAL是一套覆盖32种非洲语言的开源语音数据,比赛由Google与数据科学社区Zindi合作,参赛者首先围绕Lingala和Shona构建自动语音识别系统。项目想解决一个长期被忽视的问题:数百万人日常主要使用本地口语,但主流语音AI往往听不懂他们。
CoinMeta
·2026-09-23 09:51:39
16
查看更多