返回全部项目

HUMAN–AI INTERACTION

AI-PPT Tutor

一个以课件证据为基础的学习工作区,以及一项有 36 人参与、研究 evidence grounding 与 source attribution 的实验。

React / Next.jsEvidence groundingHCI
我的角色
Co-creator、开发者与研究负责人
当前状态
产品已上线 · 研究论文已投稿
时间
2026
AI-PPT Tutor 学习工作区:课程讲解与带页码、高亮的证据来源并列展示。
项目截图由 Bingxu Hou 提供。 查看完整尺寸截图

从一次 Java 课件学习开始

用通用 AI 助手学习 Java 时,我经常遇到两件事:明明要求它用适合初学者的方式、配合具体代码讲解,对话变长后,讲解方式却会逐渐偏离;有时它还会打乱课件顺序,让我很难把回答与课堂内容对应起来。为了继续学习,我不得不反复补充同样的要求。

这段经历成为我与 Luocheng Xie 共同开发 AI-PPT Tutor 的起点。我们围绕课件本身组织学习工作区:保留课程上下文、提供明确的学习模式,并让学生能够直接查看一段讲解所依据的原文。

先把课件读准确

产品支持最大 20 MB 的 PDF 与 PPTX。Adaptive OCR 管线优先使用可用的原生文本,对需要识别的页面调用 Tesseract.js,同时为扫描材料提供 Full-page OCR。原生文本与识别结果会合并、去重,OCR 置信度也会进入后续证据处理,而不是把清晰的数字课件与扫描页一视同仁。

图表、示意图和代码截图同样承载教学内容。管线结合 Canvas 页面处理与 qwen3-vl-plus 视觉分析,保留页码、裁剪坐标、摘要和缩略图;文件类型与签名检查、解析超时和内容限制,则为文档导入建立了明确边界。

技术重点:在生成回答之前,先保留证据的质量与位置。

从检索走向可核验的回答

我们在结构化分块上结合 BM25 与向量检索、多查询扩展、Reciprocal Rank Fusion、MMR 去重和 reranking。标题、定义、列表、表格与代码保留为有意义的单元,排序也考虑位置、相邻页、OCR 置信度和视觉证据可靠性。面对整份课件的讲解,系统采用按顺序覆盖文档的方式,而不是只返回少量局部相关片段。

界面通过 claim-level citations、原文高亮与来源跳转,让这些处理过程最终成为学生可核查的依据。材料无法支持的问题可以触发部分或完整拒答。Tutor、Explain、Q&A、Quiz 和 Review 则是进入同一份材料的不同学习方式,而不是彼此割裂的聊天。

让学习流程能够继续

真正可用的学习工具还要处理流程中断。IndexedDB 保存工作区、证据和对话,SHA-256 文档指纹避免重复处理,签名检查点支持恢复中断任务。进度提示、取消与重试控制,让耗时的文档处理不再只是等待。向量服务或 reranking 不可用时,系统会回退到关键词检索。工作区保存在本地,但 AI 处理仍使用配置的服务端服务。

不仅构建,也研究它

在共同开发产品之外,我以第一作者身份负责相关研究,亲自主持 36 人参与的实验流程,并承担伦理材料、UEQ 与 S-TIAS 测量、manipulation checks、访谈、测验和 factorial analysis。为了分别检验 grounding 与可见来源标注,2×2 实验采用固定、人工核验的证据索引,而非后续产品的完整检索管线。

实验发现 grounding × attribution 对感知信任存在显著交互作用,但用户体验和学习表现没有显著效应。论文已投 IHCI 2026,2026 年 8 月记录中的状态仍为结果待定。这个项目将我希望持续投入的两件事连在一起:做出可用的系统,并检验设计究竟带来了什么变化。

RESEARCH NOTE

查看研究详情: 2×2 Factorial Study

NEXT / LET’S TALK

从这个项目,聊到下一个想法。

想了解技术细节、讨论研究问题,或交流合作机会?欢迎给我发邮件。

联系我severushou@outlook.com