先给判断:看两件事——能不能在没有提示的情况下独立完成任务,和能不能判断 AI 的输出对不对。 "会演示"指跟着步骤能走一遍;"真的会用"指换了客户、换了产品,还能自己拆解出该怎么做。两者的差别就在这里:前者依赖步骤,后者依赖判断。
分界点:随堂出题,给一个课上没讲过的客户案例,看学员能不能独立处理。 处理得了是会,处理不了是没会。
决策速览
- 三个层次:会用工具 → 会判断输出 → 会教别人。
- 一个测法:换一个课上没讲过的案例,随堂测试。
- 一个提醒:演示能力容易装,独立处理能力装不了。
- 一个信号:学员能不能指出 AI 输出的问题,是判断能力的分水岭。
- 一个底线:涉及价格、MOQ、交期、付款、认证、赔偿、独家代理的输出,必须人工确认——学员知不知道这条,是必测项。
读者真正卡在哪?
- 老板:培训结束时大家演示得很好,一个月后没人用。
- 经理:没办法验收效果,只能看"有没有在用"这种模糊标准。
- 业务员:课上跟着做能完成,自己面对客户时还是不知道从哪开始。
核心问题是:培训效果没有可测量的验收标准。 没有标准,就只能靠感觉评判,而感觉通常被骗——演示流畅会让人误以为学会了。
团队用没学会,该分哪三个层次验收?
| 层次 | 定义 | 测试方法 | 通过标准 | 常见误判 |
|---|---|---|---|---|
| 第一层:会用工具 | 能完成基本任务 | 给标准任务,限时完成 | 独立完成,不需提示 | 演示流畅被当成会用 |
| 第二层:会判断 | 能识别输出对错 | 给出含错误的 AI 输出,请他挑错 | 能指出问题并说明原因 | 被"看起来对"骗过 |
| 第三层:会复现 | 能教别人 | 让他给同事讲一遍 | 讲清判断依据,不只是步骤 | 只讲步骤不讲依据 |
| 底线项:知道边界 | 知道哪些必须人工 | 问"哪些输出不能直接用" | 能说出涉及商务决策的项 | 只知道"要小心" |
第三层最容易被跳过,但它才是团队复制的前提。 只有一个人会用,团队整体能力没提升。
验收测试表长什么样?可以直接照着用吗
| 测试项 | 出题方式 | 评分要点 |
|---|---|---|
| 独立完成任务 | 给一个课上没讲过的客户案例 | 能否独立完成,用时多少 |
| 判断输出质量 | 给一份含错误的 AI 输出 | 能否找出错误并说明原因 |
| 判断客户阶段 | 给一段真实询盘(脱敏) | 能否判断客户处于哪个阶段 |
| 说明判断依据 | 请他说为什么这么做 | 能否说清依据,而非只说步骤 |
| 识别边界 | 问哪些必须人工确认 | 能否说出具体项(价格、交期等) |
| 换产品复现 | 换一个产品重新走一遍 | 能否自己拆解出新流程 |
| 教给同事 | 让他给同事讲一个环节 | 同事能否听懂并复现 |
七项过五项算合格,七项全过算优秀。 过三项以下,要重新培训。
不同岗位的验收重点有什么不同?
| 岗位 | 重点验收 | 可以放宽 |
|---|---|---|
| 业务员 | 独立完成任务、判断客户阶段 | 教给同事 |
| 外贸经理 | 判断输出质量、教给同事 | 独立完成速度 |
| 老板 | 识别边界、判断是否需要投入 | 具体工具操作 |
| 新人 | 独立完成任务(基础) | 换产品复现 |
| 市场 / 运营岗 | 独立完成任务、判断输出质量 | 客户阶段判断 |
这笔账怎么算?
培训效果可以这样估:
真实能力 = 独立完成任务数 ÷ 提示依赖度
- 独立完成任务数:无人协助下完成的任务数量。
- 提示依赖度:完成任务时需要的提示次数(越少越好)。
代入矩阵(行 = 独立完成任务数,列 = 平均提示依赖次数):
| 独立任务 \ 提示依赖 | 3 次 | 1 次 | 0 次 |
|---|---|---|---|
| 2 个 | 0.67 | 2.0 | 极高 |
| 5 个 | 1.67 | 5.0 | 极高 |
| 10 个 | 3.33 | 10.0 | 极高 |
| 20 个 | 6.67 | 20.0 | 极高 |
读法:"零提示"是分水岭。 需要提示才能完成的任务,说明方法还没内化。所以验收测试必须是"闭卷"的——不给提示、不给模板、不给参照。
什么情况下,上面的结论要推翻?
- 培训刚结束,还没到应用的时候。 应给 2–4 周应用期再测。
- 岗位不需要独立判断(如纯执行岗)。 验收标准可以降到"按模板完成任务"。
- 业务场景高度标准化。 判断空间小,重点验收执行准确度。
- 团队规模极小。 由老板直接观察即可,不必设计复杂测试。
- 公司只需要单一用途。 只测这一个用途,不必全面验收。
- 培训目标就是"了解 AI 能做什么"。 那验收标准应相应调整为认知层面。
正确的顺序是什么?三层怎么依次测
第一步,测"独立完成"(培训结束当天)。 给一个课上没讲过的案例,不给提示,看能不能完成。这一层过滤掉"跟着做会、自己做不会"的人。
第二步,测"判断输出"(培训后 1–2 周)。 给一份刻意包含错误的 AI 输出,请他挑错。这一层过滤掉"只看结果对不对、不看逻辑对不对"的人。
第三步,测"复现与教人"(培训后 1 个月)。 让他给同事讲一遍,或者换一个产品重新走一遍。这一层找出可以当内部讲师的人。
贯穿:测边界意识(每次都要问)。 "哪些输出必须人工确认?"——这个问题每次都要问,直到能脱口而出。
对照着看:站内《外贸团队AI能力怎么测?三档自测与带教用法》给了三档自测标准;《AI外贸培训到底学什么?为什么只学提示词很难落地》讲培训内容该是什么。
判断团队是否真的会用:常见问题
培训结束时演示得好,能说明学会了吗?
不能。 演示是跟着讲师步骤走的,属于"有提示"状态。真正的测试是撤掉提示,给一个新案例。
一般要多久才能看出真实效果?
按经验区间,培训后 2–4 周可以看到是否真的在用。判断标准是:日常业务里有没有出现使用痕迹(任务记录、使用频率、同事之间的讨论)。
用什么题来测最准?
用"课上没讲过的客户案例"。 这是关键——讲过的案例都带有记忆,测不出迁移能力。案例要来自你们自己的业务(脱敏),这样才有业务相关性。
有人学了还是不会,怎么办?
先分清是"方法没掌握"还是"业务基础不够"。业务基础不够的,要先补业务(客户判断、询盘分析),再学 AI。方法没掌握的,用一个真实任务带他做一遍。
怎么判断一个人能不能当内部讲师?
看他能不能讲出判断依据而不只是步骤。只会讲"点这里、点那里"的,不能当讲师;能讲"为什么这一步要看这个、不看那个会怎样"的,可以。
是不是所有人都要测?
建议都测,但标准可以按岗位调整。业务员重点测独立完成,经理重点测判断与教人,老板重点测边界意识。
测出来不达标,是培训的问题还是人的问题?
先看是不是"培训没有产出可用的东西"。 如果培训结束时没有可用的模板和任务,那不达标是培训的问题。如果有产出物但没人用,那是管理或人的问题。两种情况要分清楚,别一概归到人身上。
下一步
现在做一件事:从你们业务里挑一个"课上肯定没讲过"的客户案例(脱敏),发给参加过培训的人,要求 30 分钟内独立产出一份处理方案。 收上来只看两点:有没有用对方法、能不能说清为什么。 这两点能答上来,培训就没白做。
想聊你自己的具体业务场景,联系大宗师网络(外贸社媒训练营):微信 Dazongshi98。
本篇常见问题
读者真正卡在哪?
老板:培训结束时大家演示得很好,一个月后没人用。经理:没办法验收效果,只能看"有没有在用"这种模糊标准。业务员:课上跟着做能完成,自己面对客户时还是不知道从哪开始。核心问题是:培训效果没有可测量的验收标准。没有标准,就只能靠感觉评判,而感觉通常被骗——演示流畅会让人误以为学会了。
什么情况下,上面的结论要推翻?
培训刚结束,还没到应用的时候。应给2–4周应用期再测。岗位不需要独立判断(如纯执行岗)。验收标准可以降到"按模板完成任务"。业务场景高度标准化。判断空间小,重点验收执行准确度。团队规模极小。由老板直接观察即可,不必设计复杂测试。公司只需要单一用途。只测这一个用途,不必全面验收。培训目标就是"了解AI能做什么"。
正确的顺序是什么?三层怎么依次测?
第一步,测"独立完成"(培训结束当天)。给一个课上没讲过的案例,不给提示,看能不能完成。这一层过滤掉"跟着做会、自己做不会"的人。第二步,测"判断输出"(培训后1–2周)。给一份刻意包含错误的AI输出,请他挑错。这一层过滤掉"只看结果对不对、不看逻辑对不对"的人。第三步,测"复现与教人"(培训后1个月)。