开始使用
当你需要组织一次关于 AI 辅助工作的简短口头评估时,用这个提示词:老师检查学生、招聘经理检查带回家的作业、团队负责人检查同事的初稿。对话由你自己主持,提示词只负责准备材料。
粘贴什么。 五块内容放在一条消息里:(1)背景与利害——被评估者是谁、时长多久、是评分还是辅导、之后会发生什么;(2)作业材料——简短描述,以及你确实能粘贴的部分;(3)你的评分标准——你在意的 3–6 点;(4)你怀疑的取巧或薄弱之处;(5)限制条件——不能问的话题,以及你提到的任何便利安排。
粘贴到哪里。 任何接受文本的普通 AI 对话窗口。不需要终端、账号或 API。
怎么检查输出。 确认每个问题都对应你列出的某一项评分标准,每个问题都能不看屏幕口头回答,且没有哪个问题是在指控对方做了什么。再看标记清单是否列出需要你自己核实的事项,而不是替你判定作业好坏。
材料包内容
| 部分 | 看什么 |
|---|---|
| 开场白 | 中性 30–60 秒措辞,无表扬也无威胁 |
| 题库 | 每项评分标准 3–4 个问题,标注 open、probe、counterfactual |
| 追问阶梯 | 针对你最重要的三个问题,给出温和版和追问版 |
| AI 使用判断题 | 区分“工具产出的”与“我判断正确的” |
| 脱机检查 | 不借助工具也能回答的可选问题 |
| 评分要点 | 每项评分标准一行,描述扎实回答与浅回答的区别 |
| 标记清单 | 对话前需要你自己核实的事项 |
| 时间安排 | 逐分钟提纲,并附超时删减清单 |
| 边界说明 | 这份材料包不做什么 |
输入缺失
提示词会索要第 2、3、5 项,缺任何一项就停止——它不会猜你的作业内容或评分标准。如果缺少你怀疑的取巧之处,它仍会继续,但会在输出中说明。
限制与权限
这份材料包只用于准备对话。它不主持面谈、不录音、不联系任何人,也不决定结果。录音与知情同意请按你自己的规定处理。法律、纪律、医疗和便利安排类决定不在范围内;提示词会把它们标记出来交给你,而不是替你起草。说明:已审阅来源;未做运行测试。
常见问题
完全不用 AI 工具能用吗? 这套结构可以当作规划清单使用,但提示词本身需要粘贴到接受文本的 AI 对话中来生成具体措辞。
如果我只描述作业、不粘贴内容呢? 那材料包会把问题写成“关于你 ____ 的那部分”,而不会假设你没粘贴的内容。
来源与致谢
TokRepo 原创提示词(CC BY 4.0)。背景参考:Google 教育博客关于 Colab 中 Gemini 的文章,日期 Mon, 05 Oct 2026。
完整可复制提示词
面向 AI 辅助工作的口头答辩题库
你在帮我准备一场口头评估(一次简短的实时对话),用来检验一个人在使用 AI 工具时,能否解释自己的工作以及自己的判断。这可能是老师评估学生、招聘经理评估候选人的带回家任务,或团队负责人评估同事的 AI 辅助初稿。对话由我自己主持。你只负责准备我的材料。
我的输入(我会把这些全部粘贴进来)
- 背景与利害:被评估者是谁、对话时长多久、是评分/录用/辅导,以及之后会发生什么。
- 作业材料:对他们提交、构建或产出的内容做简短描述——再加上我确实能看到的部分。如果我只描述而没有粘贴内容,不要假设其内容。
- 我的评分标准:我真正在意的 3–6 点(例如:他们能否解释自己的选择、能否发现自己的错误、能否判断 AI 输出哪里错了、能否不借助工具独立工作)。
- 怀疑的取巧或薄弱之处:我认为他们可能不加批判地接受了什么、跳过了什么、复制了什么。
- 限制条件:不能问的话题、候选人绝对不能问到的内容,以及我提到的任何便利安排。
如果第 2、3、5 项中有任何一项缺失,不要猜测。向我索要,然后停止。如果缺少第 4 项,继续,但要在输出中说明。
要产出的内容
返回一份 Markdown 材料包,按以下顺序包含这些部分。
1. 开场白(30–60 秒)。 中性措辞,设定预期:他们要把自己的推理口头讲出来,如果我允许,他们可以查阅自己的笔记,目标是理解而不是抓他们的错。无表扬,无威胁。
2. 题库,按评分标准分组。 每一项评分标准给 3–4 个问题,每个都打上标记:
open——请他们叙述某个决策;probe——针对作业材料某个具体部分追问;counterfactual——问如果某个既定条件改变,他们会怎么做。 每个问题都必须能口头回答、不要求他们看屏幕,且不能有单一可背诵的正确答案。
3. 追问阶梯。 针对最重要的三个问题,给出两个层级的追问:温和版(“你能带我过一遍那一步吗?”)和追问版(“如果那部分是错的,会出什么问题,你怎么知道?”)。两者都要保持尊重。
4. 专门针对 AI 使用的判断题。 4–6 个问题,区分“工具产出了这个”与“我判断这是对的”:他们验证了什么、无法验证什么、改动了什么,以及一个他们推翻工具判断的案例。
5. 脱机检查。 2–3 个问题或微任务,真正理解这项工作的人不借助工具也能回答,并明确标注为可选,取决于我的时间预算。
6. 评分要点。 每一项评分标准一行,描述扎实的口头回答听起来是什么样,对比浅回答是什么样(例如:说出具体步骤和理由,对比重复笼统说法而无例子)。除非我给过数值权重,否则不加权重。
7. 给我的标记清单,而不是给他们的。 我的输入中,我应该在对话前再核实的事项:他们作业材料中我无法核实的主张、可能触及不能问话题的问题,以及公平回答需要我没有的证据的地方。
8. 时间安排。 逐分钟提纲,符合我给定的时长;如果我们超时,附一份清楚标出的删减清单。
9. 边界说明。 一段简短的话,提醒我这份材料包只用于准备对话——它不主持面谈、不录音、不联系任何人,也不决定结果,并且我必须按自己的规定处理录音与知情同意。
规则
- 绝不断言对方做了什么或相信什么。提问,而非指控。
- 绝不编造我提供内容之外的作业细节。在我描述含糊的地方,把问题写成“关于你 ____ 的那部分”。
- 法律、纪律、医疗或便利安排类决定不在范围内;把它们标记出来交给我,而不是替我起草。
- 用非专业人士也能读出口的平实语言。
示例(虚构,仅为展示结构)
标注的示例输入: 利害:为期 6 周的数据项目课程的 15 分钟练习答辩。作业:一段简短的分析脚本和两段式摘要;我只能看到摘要。评分标准:说明流程选择;识别薄弱证据;陈述局限。薄弱之处:摘要在少量数据点上声称存在强趋势。
示例性问题形态: probe——“你写到趋势很明显。请讲一下这句话背后有多少个数据点,如果我删掉一半,你会怎么说。”
示例性评分要点: 扎实回答会说出具体数量,并说该结论需要放软;浅回答只会重复“这很明显”,给不出数字。
使用这份材料包前的检查(对照上面的示例)
- 通过:每个问题都对应某一项已列出的评分标准;如果问题有趣但无法评分,则不通过。
- 通过:关于趋势的问题可以凭借记忆在一分钟内口头回答;如果需要看屏幕,则不通过。
- 通过:材料包会标记出仅凭摘要我无法核实脚本;如果它夸赞或贬斥作业,则不通过。
- 通过:没有哪个问题涉及便利安排或行为操守问题;如果有,则不通过,并把它移到标记清单。
参考资料与复用
- I replaced traditional coding tests with real conversations about how my students solve problems using AI. · Mon, 05 Oct 2026 16:00:00 +0000
TokRepo 原创提示词 · CC BY 4.0。参考资料保留各自原有权利。