铭鸿体育资讯网

AI 个性化学习家教:香港大学开源 DeepTutor,聊天解题,因人施教

DeepTutor 是来自香港大学数据智能实验室的开源项目——一个以 agent-native 架构构建的终身个性化学习

DeepTutor 是来自香港大学数据智能实验室的开源项目——一个以 agent-native 架构构建的终身个性化学习伴侣,

我们一直用错了 AI 辅助学习

过去几年,"AI 辅助学习"这个词被滥用到了边界模糊的地步。现实却很简单:大多数工具不过是一个更聪明的搜索框,或者一个能生成习题的文本生成器。你问,它答;你切换标签页,上下文消失,一切归零。

DeepTutor 的出发点是:把这件事彻底做对。 不是用 AI 包装一个搜索引擎,而是构建一个真正意义上的学习伴侣——它记得你,它理解你的知识结构,它能随着你的成长持续进化。

核心主张:

学习不是一次性事件,而是终身过程(Lifelong Personalized Tutoring)。DeepTutor 的一切技术决策,都在为这一理念服务。

这个项目来自香港大学数据智能实验室(HKUDS),完全开源,基于 Apache 2.0 协议。

什么是 Agent-Native 架构?

在解释 DeepTutor 做什么之前,先理解它怎么做到的——这很重要,因为架构决定了上限。

传统 AI 学习工具是"功能叠加"模式:聊天是聊天,做题是做题,搜索是搜索。每个功能各自为政,数据不互通,上下文无法流转。

DeepTutor 的选择完全不同。它把所有功能——Chat、Quiz、Research、Visualize、Solve、Mastery Path——建立在同一个 agent 运行时之上。这意味着:

上下文跨界面流转:你在 Chat 里上传的教材、在 Quiz 里做错的题、在 Co-Writer 里写的笔记——在所有界面里共享,互相感知。工具按需挂载:Agent 会根据任务自动挂载 rag、web_search、reason、write_memory 等工具,而不是让你手动切换。切目标,不切引擎:从聊天切换到深度研究、再切到出题,是同一个引擎在不同模式下运行,而非启动新会话。子智能体协作:可以在对话中途召唤 Claude Code、Codex 等编程 CLI,或自定义 Partner,作为子智能体实时协作。

这不是 UI 层面的整合,而是运行时层面的统一。这是 DeepTutor 与市场上所有同类产品的根本差异。

八个界面,共用一套大脑

打开 DeepTutor,你会看到侧边栏里排列着八个工作台。它们不是相互独立的产品,而是同一套 agent-native runtime 的不同"镜头":

主页 CHAT —— 你真正使用的 AGENT LOOP

Chat 是最常用的入口。一个对话线程里,你可以正常聊天、调用工具、检索知识库、读取附件、生成图像、咨询子智能体,并把重要信息写入笔记——在跨轮次的同一上下文里完成这一切。Agent 按轮思考:调用工具、观察结果、然后给出不含工具调用的最终回复。需要时,它可以暂停并向你提问,等你确认再继续。

PARTNERS —— 有记忆、有人格的持久伙伴

Partners 是具有独立人格(SOUL.md)、资源库与 IM 渠道的持久伴侣。它的本质是:一个拥有人格和"电话号码"的 Chat。每条来自微信、Telegram、Slack 等 IM 的消息,都会在 Partner 的 workspace 内触发一次完整的 ChatOrchestrator 轮次。Partner 可以读取你的记忆,但只写入自己的私有记忆空间。

三层记忆(MEMORY)——可审计的个性化

这是 DeepTutor 最具差异性的设计之一。大多数 AI 系统的"记忆"是一个不透明的向量数据库,你不知道它记了什么,也无法审计。DeepTutor 的记忆是文件驱动、三层可审计的:

L1 · 事件追踪:所有交互的原始事件流,以 .jsonl 格式逐条追加,永不修改。每一条记忆都能追溯到原始事件。L2 · 表面摘要:按学习场景(chat / quiz / book / kb…)提炼的结构化事实,存为 Markdown,可直接阅读和编辑。L3 · 跨场景综合:在 L2 基础上做跨场景分析,生成个人画像、近期状态、偏好摘要。L3 引用 L2,L2 引用 L1——链路完整,无法伪造。

Memory Graph 把这套三层体系可视化为一张力导向图:L3 居中,L2 中间环,L1 外圈——任意一条综合结论都能点击追溯到背后的原始事件。这是 AI 个性化领域少见的透明度设计。

知识中心与"活页书":把文档变成伙伴

知识库(Knowledge Base)是 DeepTutor RAG 的底座。它支持五种检索引擎,覆盖从轻量本地到知识图谱的全部场景:

每个知识库绑定一个引擎,支持版本化索引(每次重建写入新的 version-N 目录,原索引保留),支持单文档精确删除,支持多种文档解析引擎(MinerU、Docling、PyMuPDF4LLM 等)。

在知识库之上,Book 模块实现了一个真正意义上的"活页书"编译器:把你的知识库、笔记、对话历史编译成一本可交互的书,而不是静态 PDF。每一章由带类型的内容块组成——文本、Quiz、闪卡、时间线、代码、交互式 HTML、Manim 数学动画、概念图……每页有独立的 Page Chat,任意块可以插入、移动、重新生成或切换类型,而无需重写整章。

关键在于:Book 不是一次性输出,它会"感知"源知识的变化。deeptutor book health命令可以检测知识库是否已经偏离已编译的页面内容,提示你是否需要刷新。

CLI:让另一个 Agent 来驾驶 DeepTutor

DeepTutor 有一个设计理念很少被提及,但极有工程价值:它被设计成可以被另一个 agent 操控。

BASH · 三行上手

# 1. 安装并初始化

pip install -U deeptutor

deeptutor init

# 2. 启动(后端 + 前端一起)

deeptutor start

# 3. 浏览器打开 → 开始使用

# 默认地址:http://127.0.0.1:3782

BASH · CLI 链式调用示例

# 发起深度研究,捕获 session_id

SID=$(deeptutor run deep_research "综述2026年RAG进展" \

--config mode=report --format json \

| jq -r 'select(.type=="done").session_id')

# 在同一 session 下继续:基于报告出题

deeptutor run deep_question "根据上面的报告出3道考题" \

--session "$SID" --format json

repo 根目录还附带了一份约 150 行的 SKILL.md——这是给其他 LLM 读的"接管文档",Claude Code 和 Codex 遇到它时会自动加载,立刻知道如何驾驶 DeepTutor。这种设计在开源工具里很少见,体现了项目对 agent-native 生态的严肃承诺。

EduHub:技能生态与开放标准

DeepTutor 还在构建一个叫做 EduHub 的技能市场。技能(Skill)是一个包含 SKILL.md(YAML frontmatter + Markdown)的文件夹,描述了某项专业能力的行为规范——苏格拉底式问答导师、闪卡生成器、论文反馈智能体……

技能格式完全开放,任何支持 Agent-Skills 格式的注册表都可以作为来源。DeepTutor 内置 EduHub 和 ClawHub 两个技能源,支持一行命令安装:

BASH · 技能管理

# 搜索社区技能

deeptutor skill search "socratic tutor"

# 安装并验证(通过安全门禁后注册到本地库)

deeptutor skill install socratic-tutor

# 发布你自己的技能

deeptutor skill login

deeptutor skill publish ./my-skill

每次技能安装都经过安全门禁:检查注册表安全评级、防 zip-slip / zip-bomb 提取、白名单后缀校验、清理 always: frontmatter(防止技能强制插入所有 system prompt)、写入 .hub-lock.json 追踪来源与版本。在多用户部署中,技能安装是管理员专属操作,安装后需显式授权才对其他用户可见。

它值得认真对待

DeepTutor 不是又一个"AI 学习助手"。它是一次认真的工程实践:agent-native 运行时、三层可审计记忆、多引擎 RAG、活页书编译器、Partner IM 集成、Skills 生态……每一个模块都有清晰的设计意图,而不是堆砌功能的结果。

当然,它还在快速演进,有些功能还有粗糙的边缘——OpenAI Codex OAuth 仍是实验性的,部分 IM 渠道需要额外依赖,多用户部署的文档仍在完善中。但这些问题都在发布日志里坦诚列出,项目的迭代速度和社区透明度都让人对它的未来有信心。

如果你关注 AI 教育、个性化学习、或者 agent-native 架构的工程实践,DeepTutor 都是一个不应该错过的参照物。它免费,开源,可以本地部署,三行命令跑起来。