很多 AI 项目失败,不是模型能力不够,而是第一个流程选得太大:同时连接多个系统、覆盖多个部门、没有统一规则,还希望立刻无人值守。一个更稳妥的起点,是选择能在几周内看清输入、过程和结果的真实任务。
OpenAI 关于识别和扩展 AI 用例的指南建议从高影响、较低实施难度的机会开始。这里的“影响”不只等于节省工时,还包括减少返工、缩短等待、提高一致性和让问题更早暴露。
先用五个维度评分
可以给候选流程每项打 1 到 5 分:
| 维度 | 高分特征 | 低分特征 |
|---|---|---|
| 频率与耗时 | 每天或每周重复,占用多人时间 | 偶尔发生,单次成本很低 |
| 规则清晰度 | 步骤、字段和完成标准能写出来 | 主要依赖隐性经验和临场谈判 |
| 数据可得性 | 输入集中、格式可识别、授权明确 | 数据散落、质量不明或无权访问 |
| 结果可复核 | 人能快速判断对错并指出原因 | 结果要很久以后才知道是否正确 |
| 风险与可逆性 | 先生成草稿,失败容易重做 | 直接影响资金、客户承诺或生产数据 |
前四项越高越适合先做;风险越高越应降低自动执行范围并增加审批。评分不是为了制造一个精确公式,而是让业务、技术和负责人基于同一组事实讨论。
合适的首批任务
商品资料清洗与内容草稿
输入通常是商品表、品牌规则和渠道字段,输出是整理后的表格、描述草稿和缺失项清单。团队可以逐行比较,且不必一开始就自动发布。
客服工单分类与回复草稿
Agent 可以识别主题、查找知识来源并准备回复。敏感问题、低置信度和最终发送保留给客服人员。这类流程容易记录处理时间和人工修改率。
表格整理与周报初稿
把固定格式的 Excel 或 CSV 汇总成异常清单和管理摘要。关键是让计算过程、字段映射和来源可追踪,不把语言流畅当成数字正确。
文档提取与比较
从一组被授权文档中提取条款、差异或证据位置,交给专业人员复核。它减少查找时间,但不替代最终判断。
不适合做第一个项目的信号
- 没有人能清楚描述当前流程;
- 输入数据是否合法使用仍未确认;
- 成功标准只有“看起来更智能”;
- 一次失败就会直接影响大量客户或资金;
- 必须同时改造多个核心系统才能运行;
- 没有业务负责人愿意审核例外和结果;
- 计划依靠 Agent 自己弥补所有缺失规则。
这并不意味着这些流程永远不能自动化,而是需要先拆分。可以把“全自动商品上架”拆成资料导入、字段检查、内容草稿、人工复核和发布五段,先验证前三段,再决定是否连接发布环节。
写一页流程定义
开始构建前,用一页纸回答:
- 谁发起任务,多久发生一次?
- 输入数据来自哪里,谁有权授权?
- 当前人工步骤是什么?
- Agent 可以使用哪些工具?
- 输出格式和合格标准是什么?
- 哪些异常必须交给人?
- 哪些动作必须逐项审批?
- 如何记录耗时、错误、修改和最终结果?
如果团队无法共同写完这页定义,应该先梳理流程,而不是直接增加更多模型或工具。
用小样本建立基线
先选一批有代表性的历史任务,记录人工处理时间、错误类型、返工次数和结果质量。让 Agent 在不影响真实客户或生产数据的环境中运行,再比较:它节省了哪一步?新增了哪些检查?人需要修改多少?异常是否更容易被发现?
不要只记录“生成速度”。如果 Agent 很快产生大量需要重写的内容,整体成本可能更高。更有用的指标包括通过复核的比例、每项人工修改时间、缺失字段发现率和高风险动作拦截率。
从一个流程扩展,而不是从一个演示扩展
首个流程稳定后,再把通用部分沉淀为规则、字段映射、审批模板和测试样本。扩展到相邻任务时,复用这些经过验证的资产,而不是只复用一段提示词。
DoPilot 的智能体套件设计也遵循这种思路:说明任务、输入、步骤、输出、人工审批点和禁止自动执行的动作。当前电商示例属于产品演示设计,并不表示所有渠道连接都已完成。选择第一条流程时,真实边界比展示范围更重要。
来源与延伸阅读
常见问题
第一个 AI 自动化项目应该追求最大的 ROI 吗?
应关注价值,但不必直接选择最复杂、影响最大的流程。更合适的起点是价值明确、实施难度较低、结果容易验证的快速项目。
没有完整历史数据还能开始吗?
可以先从小样本和人工可检查的任务开始,但必须记录输入质量、例外情况和错误类型,不能用缺失数据推断出过度确定的结果。