我曾拥有一个看似准备就绪的系统。
一个人工智能模型负责设计架构。
另一个模型负责实施。
其他模型审查输出结果,检查逻辑,并生成验证文档。
合成法律案例通过了多项内部检查。
随后,我使用真实法律案件中的文档对系统进行了测试。
它混淆了各方当事人。
它误读了金额数字的含义。
它混合了对立的诉求。
它推断出源文档中不支持的关系。
它遗漏了显然重要的信息。
内部审查链条未能发现那些最关键的失败之处。
那天上午,工作流程转变为:
合成数据通过
→ 真实案例验证
→ 关键失败
→ 暂停发布
→ 修补
→ 独立复测
最重要的教训很简单:
多个人工智能模型之间的一致意见并不等同于现实世界的验证。
本文解释了我所使用的操作方法、失败原因以及我如何对其进行改进。
我将该方法称为奇美拉系统。
什么是奇美拉系统
奇美拉是一种由不同生物部位组合而成的神话怪物。
奇美拉系统将同样的理念应用于人工智能工作。
我不再期望单个模型能同样出色地完成所有任务,而是将不同的职责分配给不同的模型,并由人类控制工作流程。
简化版本如下:
人类定义的目标
→ 架构人工智能
→ 执行人工智能
→ 对抗性审查人工智能
→ 验证人工智能
→ 真实数据测试
→ 人类判断
→ 错误与修订日志
某个模型可能在架构设计和推理方面更强。
另一个模型可能在实施方面更擅长。
还有一个模型可能更擅长批评、比较或发现不一致之处。
人类决定目标,控制交接环节,根据现实检查结果,并决定工作流程是否继续。
该系统不绑定于任何单一模型提供商。
可以在不改变整体操作方法的情况下替换模型。
它不是什么
奇美拉系统并非声称我发明了多智能体人工智能。
角色分离、评估者-优化器模式、共享内存、编排以及人类在环工作流程早已存在。
它也不是一个完全自主的多智能体系统。
没有自定义的编排器自动创建智能体并路由任务。
没有服务器协调每一次转换。
没有复杂的应用程序接口集成。
该工作流程更好地描述为一种人类主导、基于文档的多模型系统。
其背后的实际问题是:
非开发人员能否在不先构建智能体平台的情况下,操作一个有用的多模型人工智能团队?
到目前为止,我的答案是肯定的——但前提是工作流程透明、角色明确,且真实世界测试可以否决人工智能的一致性意见。
为何使用谷歌云端硬盘
在该系统中,谷歌云端硬盘不仅仅是存储最终文件的地方。
它充当:
- 模型之间的共享内存,
- 交接通道,
- 决策日志,
- 错误记录,
- 版本追踪,
- 以及项目的恢复点。
每个模型都为下一个参与者留下一份文档。
下一个模型可以检查之前的输出,对其提出质疑,修订
免责声明:本文内容来自互联网,该文观点不代表本站观点。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容,请到页面底部单击反馈,一经查实,本站将立刻删除。