RESEARCH / 2026
Effects of Evidence Grounding and Source Attribution in Generative AI Tutors: A 2×2 Factorial Study
通过 36 名大学生参与的受控实验,研究 grounding 与 attribution 如何共同影响感知信任、用户体验与学习效果。
- 我的角色
- 第一作者 · 研究负责人
- 当前状态
- 已投稿 IHCI 2026 · 结果待定
- 时间
- 2026 年 3 – 9 月
研究及职位状态依据 2026 年 8 月 29 日的资料记录;已投稿不等于已录用。
把产品选择变成研究问题
开发 AI-PPT Tutor 时,一个问题无法单靠界面设计回答:用户体验的变化,来自回答确实基于课件证据,来自界面展示了来源,还是来自两者的配合?我希望将 evidence grounding 与可见的 source attribution 分开检验,而不是因为界面有引用,就默认系统已经产生了帮助。
先控制系统,再开展实验
研究采用 2×2 between-subjects factorial design,将 36 名大学生随机分配至 baseline、仅 grounding、仅 attribution 和组合条件,每组 9 人。实验系统使用 React/Next.js 与 qwen-plus,证据索引固定且经过人工核验;它与后续产品的 OCR/向量检索管线分开,以减少实验操纵中的检索不确定性。
系统生成结构化论断,仅在检索证据直接支持完整论断时关联引用,并提供页面跳转和原文高亮。证据呈现因而成为可操纵、可检查的系统行为,而不只是视觉装饰。
技术与方法重点:控制实验条件之间的差异,并让这些差异可以被核查。
从实验协议到数据分析
作为第一作者与研究负责人,我亲自主持实验流程,收集参与者数据与访谈。我的工作覆盖伦理材料、学习测验、UEQ 用户体验测量、S-TIAS 信任测量、manipulation checks、访谈协议和 factorial analysis;同时,我以 Co-creator 和开发者身份与 Luocheng Xie 共同构建实验系统。论文作者为 Bingxu Hou、Luocheng Xie 和 Lijie Zheng。
结果支持什么,又不支持什么
Grounding × attribution 对感知信任呈现显著交互作用(β = 2.52,95% CI [0.77, 4.27],p = .019)。UEQ 与学习表现未发现显著效应。组合条件较高的平均测验分数属于描述性结果,不能据此宣称系统提升了学习效果。
研究已完成,论文已投 IHCI 2026;2026 年 8 月 29 日记录中的状态仍为结果待定。对我而言,这项工作将系统实现与严谨评估连接起来:做出一个能运行的功能,是提出问题的起点,而不是问题的答案。
AI-PPT Tutor
NEXT / LET’S TALK
从这个项目,聊到下一个想法。
想了解技术细节、讨论研究问题,或交流合作机会?欢迎给我发邮件。