01 / 2026
Natalie
一个由 AI 辅助的导师项目。技术栈不设限制,但应当是一个兼容移动端的 Web 应用。
理解的标准
这里要解决的关键问题,是给学生施加一种理解的标准。
他们通常面临的一个问题,是他们不知道自己没有把某件事完全理解。一旦看到了答案,他们就假装自己懂了。事实上,他们是在事后合理化。这里没有学到任何可迁移的教训,所以当下次遇见一道类似的问题时,他们会以完全相同的方式失手。
然后他们来找我求助,并说:“但我什么都懂。我知道我为什么错,也知道正确答案为什么对。”
不,先生。你并不懂。你什么都不懂。你不知道自己为什么错了,这正是你需要我帮助的原因。
你已经很擅长把事情合理化。但这种合理化过程本身一点也不理性。你的应对机制里没有任何理性。你在一个科目上花了数百个小时,对该科目的洞见仍然为零。
因为你还没有形成一种感受:真正理解一件事究竟是什么样子。
学生脑中的提问者
一个真正糟糕学生的标志,是无法形成一个好问题。这是意料之中的事。如果他们完全不知道自己不知道什么,你怎么能指望他们知道该问什么?
我想做的,是成为他们本应在自己脑中拥有的提问者:如果他们不需要我,本来就会拥有的一个苏格拉底式牛虻。
我并不需要一个额外付费的导师来替我做这件事。我自学,提出好问题,再相应地回答它们。
我通常能帮助学生到达一个好的位置。这是因为我在 LSAT 分数尚未像今天这样膨胀时考到了 177,也因为我帮助过许多学生显著提高分数。
我以一种很苏格拉底的方式做这件事,但我觉得这个词在大多数情形里都被误用了。
我的苏格拉底方法,是向学生提出最严苛的问题。它们严苛,并不是因为难。它们严苛,是因为我不会放过最微小的细节。只有当我满意地确认学生真正理解了他们所谈论的每一个词,我才会让他们继续。
我与学生一对一课程的逐字记录证明了这一点。它们证明了两件事:
- 学生画像:能力和人格各不相同的学生。
- 我的教学方法:我如何把它调整给不同类型的学生。
目标一直都是确保他们真的理解。与此同时,我也会驱散一些围绕学习、捷径的可能性,以及 IQ 与在考试中取得卓越成绩之间关系的错误观念。
我尝试以最有效率的方式实现总体目标:提高学生的 LSAT 分数。许多学生非常喜欢我的方法。有些人甚至说,当他们独自做这些题时,我现在“住”在他们的脑中。
这一切都有逐字记录为证。我实践这门技艺的方式有相当完整的记录。有时教学是双语的,但指导原则没有变。
一种新的人机形式
我们与机器互动的方式,受到以下事实的约束:我们知道对方并不是一个真正的人。我们不会把作为一个人的我做成数字复制品,再让产品假装学生正在同我交谈。这没有用。我们不会去尝试。
产品不会假装能做到不可能的事。我们会找到一种新的互动形式。
在一端是人与人的互动。在另一端是人与 UI 的互动,传统上 UI 一直是确定性的。随着 AI 的出现,界面可以不那么确定。它可以处在我们已经习惯的两种形式之间。
这种新形式应当从旧式 ACG 游戏中获得灵感。它将主要由文本驱动。可以启用语音到语音的互动,但那是次要的。用户会知道自己在和机器说话。
文本驱动的对话给用户以按自己速度阅读的自由。他们甚至可以跳过。用户应该拥有自由。
对话的每一轮里,用户都应收到三到四条可以作为输入选择的预制提示。如果预制提示里没有一条符合他们想要的内容,他们也可以自己写提示。
这绝对是必要的,因为你不能给这些学生太多自由。他们不想要探究的自由。他们需要被限制在做选择之中,而且是相当简单的选择,因为他们尚未获得批判性思维的能力。如果他们已经获得了,就不需要我。
我从文本驱动游戏中获得灵感。也许这样的产品已经存在。我不确定。重要的是细节:我们如何组织提示与学习路径,如何发现一个学生的脆弱点,以及如何确保当学生说自己懂了时,他们真正理解。
我们怎样测试真正的理解?我们会从不断积累的真实一对一课程中获得线索。那些课程本身也会随着我调整和完善这门技艺而演进。
从教学记录到自适应系统
考虑到我只是一个人,我能教的学生数量是有限的。我并不打算创造我的数字复制品。如前所述,那没有用。我会创造一个新的存在,它位于一种新的人机学习体验之中。
我们也可以从心理治疗与精神分析中获得线索。我一直在读弗洛伊德,读他在患者没有完整回忆时重构事件、意义与重要性的方式。
导师也可以自我演进,甚至成为 RSI。首先,我们从学生那里取得数据。真实学生会同程序互动,并表现出可识别的智力问题模式。我们可以把它们当作支撑。例如,当一个学生提交的自定义提示展示出一个有价值的问题时,我们可以把它作为选项,复用给处在类似位置的下一个学生。
尽管可能路径的数量可以无限,理论上 AI 可以帮助我们把它们考虑进去。随着程序服务更多的人,我们也可以预先计算常见路径。
程序应当追踪每个人的进展,以及怎样向这个学生呈现材料最为合适。但它不能走向极端个性化,因为好的推理和好的思考是相似的。我们要把学生引向一个可测量、可量化的结果:一个好的 LSAT 分数。
我现在认为,这项工作不必始终受限于 LSAT。我们在教批判性思维,而在 AI 时代,这可能是最重要的人类技能之一。它也是通往法律职业或任何专业职业的前提。但 MVP 应当在 LSAT 上。
随着学生使用产品更多,画像应当变得更完整,教学也应更个性化。如前所述,应当有清晰边界。我们会在一起编程时探索它们。
定期应有完整格式的诊断测试。我们应利用它们确认或纠正学生画像。我们甚至可以对用于描述学生的小模型进行后训练,尽管我对这项技术还不完全确定。也许是一个嵌入模型?
图机器学习能帮助我们绘制这些路径吗?
第一次诊断与第一堂课
想象一张白纸:一个对这门考试一无所知、也还没有尝试过任何题目的学生。我们应从一次可以在十五到二十分钟内完成的诊断开始。
测试学生如何构造包含量词的句子的否定;如何把“only if”“unless”“if”“or”和“and”转化为等价形式;如何理解必要条件和充分条件;如何论证因果结论;以及如何在一个极长的句子中找出主语、动词和名词。这些概念不应以抽象方式测试,而应通过真实例子。
然后给他们一些真实题目。
梅奥诊所可能做过某种类似的事,帮助病人自我诊断。这里是同一个想法。
之后,询问他们的抱负、目标分数、学术背景和阅读习惯。
然后立刻开始第一堂课,它同样围绕问题展开。如果学生在条件推理上很弱,就给他们那门课。
每一条提示,也就是我们想对学生说的材料,都不应长于一道典型的逻辑推理题。学生可以选择让提示更简洁或更详细。我们也会收集这些数据,并推荐我们认为最适合每个学生的呈现方式。
作为回应,学生可以说:“我很久以前就知道这个,所以请别再给我类似材料了”,“是的,继续给我这些”,或者“行,我懂了。”他们也可以提出一个自定义问题。我认为最多应有三个固定选项和一个自定义可能性,不过这个数字本身也可以配置。
学生如何做一道题
做真实 LSAT 题时,给学生按自己意愿行动的自由:他们可以从排除选项开始,也可以直接选择符合自己对正确答案预期的那个。在过程结束时,我们给出自己的建议。
对于无法提前合理或合乎逻辑地预期某个选项的题目,唯一的做法是排除。对于其他题目,更合理的程序是在继续之前“预想”或预期一个好的答案选项。
我们也可以要求学生在某些题里排除选项,并追问他们的理由。我们可以提供典型的推理动作,例如“我觉得这不相关”或“我说不清,它就是感觉不对。”
如果他们说不清,但排除了正确答案,我们给他们一个简短理由。但如果他们说它不相关,我们可以要求更多信息:它具体怎么不相关?
对于一道平行推理题,要追问他们:一个答案是不相似于它的推理、结论形式,还是其他东西?
调校导师
显然,我无法在这里提供每一种我们可以给用户的可能动作。将来,调校程序的方式会是我,或任何其他调校者,进入一个“调校”会话,并向它提供相关材料。
这种调校模式可能更像数据标注。已经有专业解决方案了吗?也许这是我们必须先做的事情之一。
另一个主要部分是题目重构。我们需要找到一种万无一失,或者至少 99% 万无一失的方法,来构造我们自己的人工题目。我们会先着手解构题目,把它们拆成组成性的难点。这些难点可能包括双重否定、长句、陷阱答案和细微细节。我们也应能从逐字记录中获得其中一些东西。
当我们创造自定义题目时,可以轮换不断反复出现的主题。
然后这些智能体可以充当评审。首先,不应有分歧答案。题目不应太容易。我们也应该能够调校它的难度,尽管简单题多少有点无意义。我们只做难题。
我想,调校调校过程本身有许多工作要做。人类本质上会进行一种元调校。
我们可以调校许多 AI 用户。我们会用我的逐字记录为它们编程。