智能体不是把提示词包一层界面。真正会被用起来的,要能读到业务数据、能调用现有系统、在拿不准的时候交回给人,并且每一次输出都可追溯。我们按场景交付,一个场景一个可验收的智能体,跑通一个再上下一个,不做一次性大平台。
适用对象
- 场景和验收标准已经明确(自己想清楚了,或做过 AI 咨询与诊断选型 / Design Thinking 服务设计)
- 有可用的数据源与系统接口,或允许我们做数据整理
- 需要规模化重复的工作:审核、质检、内容生产、信息抽取、报表
- 不适合:出错代价极高且无法设人工复核环节的场景
我们怎么做
- 拆任务:把场景拆成智能体能独立完成的步骤,标出哪些必须人工确认
- 接数据:整理知识来源,建检索层,明确哪些数据不进模型
- 建智能体:写工作流与提示词、接工具与系统 API、设失败回退
- 调准确率:用真实历史数据建评测集,跑到验收线才上线
- 交付与移交:运维手册、评测集、后续迭代方式一并交出
交付物
- 可运行的智能体(含工作流、提示词、工具接入)
- 评测集与准确率报告
- 人工兜底流程与权限设计
- 运维手册与迭代指引
常见问题
- 智能体和普通的 AI 对话工具有什么不同?
- 智能体能读到你的业务数据、能调用现有系统的接口、能按设定的工作流多步完成任务,并在拿不准时把任务交回给人。对话工具只有一轮问答,没有数据也没有权限。
- 准确率能做到多少?
- 不给通用数字。做法是:用你们的真实历史数据建评测集,先定验收线,跑到线上才上线,跑不到就改流程或缩小场景范围。评测集和跑分报告一并交付,可复跑。
- 数据会不会进模型训练?
- 默认不进。哪些数据进检索层、哪些完全不出内网,在接数据阶段逐项确认;有私有部署要求的在选型阶段就定下来。
- 交付了什么,之后谁维护?
- 交付可运行的智能体、评测集与准确率报告、人工兜底流程与权限设计、运维手册。之后可以你们自己维护,也可以走 AI 落地陪跑,按月跟进使用率和迭代。
- 已经做过哪些?
- 果麦文化 400 个 AI 伴读智能体;SpeedLogs 的 ControlTower、RiskClaw、SupplierEvaluation;Think-Bridge 的 VatClaw 报税自动化(后两家只公开交付内容)。已产品化的智能体在 ClawdMart 上架订阅,客户定制交付的这四个尚未上架。