美国资本市场咨询公司Chatham Financial最近给出一个比“员工都在用AI”更具体的数字:在一项交易核验的早期测量中,原本约需30分钟的人工复核,被一套由Codex辅助开发的应用压到4分钟以内。这个结果并不意味着金融交易已经交给模型自动放行。公司同时强调,应用正拿真实交易和资深复核人员的结果逐笔对照,扩大自动化范围仍是下一步计划。对于金融机构,这个限定比速度本身更重要。
交易核验听起来是后台工序,实际上要回答三个问题:客户授权了什么、交易最终执行了什么、系统记下来的又是什么。三者只要有一处错位,事后清算、风险敞口和客户报告都可能跟着出错。传统流程依靠专业人员在订单、确认书和内部记录之间反复寻找证据。Chatham的做法不是让模型凭一段文字“判断对错”,而是把收集凭据、比对关键条款、标出差异拆成可检查的步骤,最后把异常留给人处理。
真正节省的,是找到证据之前的时间
OpenAI与Chatham在10月2日披露的案例中,最值得注意的不是使用了哪一代模型,而是重新设计了工作顺序。Chatham把这套思路称为Process Zero:先确定工作应产生什么结果,再列出结果所需的最低证据,最后划清哪些判断必须由专业人员承担。AI被安排在可以结构化比较、可回溯核对的环节,员工则面对例外、解释和最终责任。这样的分工与“把整张交易单扔进聊天窗口问是否正确”不是一回事。
公司称,应用会汇集支持交易的材料,比较关键条款并提示不一致。若一笔利率对冲交易的到期日、名义本金或现金流安排在不同系统中出现差别,复核人员首先需要看到差别出现在哪里,以及依据的是哪一份原始文件,而不是只看到一行“存在风险”的模型结论。速度提升只有在证据链完整时才有价值;否则,复核时间可能只是从操作人员身上转移到了后续审计和纠错环节。Chatham没有公布样本量、各类交易的错误率或跨产品稳定性,因此不能把“不到4分钟”推广为所有交易的通用表现。
这家公司还把员工自建应用纳入内部平台Chatham Vibes。披露资料显示,这些应用中的AI功能默认采用GPT-5.6 Terra,具体项目可选用GPT-5.6 Sol。员工已用它处理即将到期的利率上限交易、固定收益报价单、对冲仪表盘和确认书审查等任务。这里的共同点是资料与规则相对明确,却有大量机械整理工作。员工能更快搭起应用,未必代表可以绕开数据权限、模型验证和客户交付审查;事实上,越多人能自己构建工具,企业越需要统一规定来源、版本、访问和变更记录。
从单点工具走向系统,难题是追溯与责任
Chatham正在开发的Onyx平台试图把资产、债务和衍生品放到有治理的数据环境中。公司说,Codex参与规划、开发、测试、文档和代码审查,而平台按任务复杂度在不同模型间选择。简单分析和非生产测试倾向于更低成本的模型,复杂任务才调用更强能力。这与“所有场景统一使用最贵模型”的做法不同:一笔交易最终的成本,不只是模型调用费,还包括读写数据、人员复核、日志留存和异常处理。
平台中的ChatFIN可以帮助用户查找历史市场数据、定位债务或衍生品相关法律文件,并附上对应链接。这样的链接不是装饰,而是金融场景里最基本的信任接口。模型若回答“某条款允许提前解除”,使用者必须能够回到合同原文,核对措辞、适用日期和交易主体。若文件版本已经更新,原先看似正确的总结也可能失效。把数据治理放在界面背后,正是企业应用区别于一次性演示的地方。
当然,案例仍是公司与技术供应商共同发布的实践材料,不是独立随机试验。它说明一类流程存在压缩空间,却尚未证明所有机构都能复制同样的效率。复杂度更高、资料不全或例外更多的交易,节省的时间可能明显不同。把早期结果写成行业平均水平,既不准确,也会掩盖那些真正需要人做判断的边界。
对金融业来说,更现实的观察指标可能不是“AI完成了多少任务”,而是复核人员有多少时间重新用于难案:他们能否更快找到证据、能否看清模型指出的差异、能否在责任不清时停下来。Chatham接下来计划扩大覆盖的交易类型,同时保留专业监督。这条路线如果经得起更大样本、更多产品和外部审计,AI才算从提高个人速度,进入了可靠的金融生产流程。就目前披露而言,它是一个有价值的早期案例,不是一张可以跳过审核的通行证。
资料来源:OpenAI与Chatham Financial,2026年10月2日案例披露。https://openai.com/index/chatham-financial/












