花卷铺

花卷铺

Reading|2026-09-26 阅读研究日报

4
2026-09-26

1. 生成式人工智能介导的苏格拉底式对话对职前物理教师运动学批判性思维的影响

原始标题: Effects of generative AI-mediated socratic dialogue on preservice physics teachers’ critical thinking in kinematics

作者与来源: Marcos Guerrero-Zambrano、Bryan Valarezo-Chamba、Leonor Sanchez-Alvarado、Erick Lamilla-Rubio;Physical Review Physics Education Research,2026。原始来源。

研究问题与理论背景

运动学学习常被简化为代公式,却要求学习者解释物理量、检验假设、协调表示并论证解答。本文把苏格拉底式对话视为推理支架,考察教师追问基础上加入生成式AI,是否伴随更好的学科批判性思维,以及自我效能、动机和认知负荷如何变化。AI的角色是促成澄清、反例与自我修正,而不是接管判断。

总体成绩检验明确采用“AI阶段优于前一阶段”的先验方向性假设;题目层面则报告双尾比较。研究还探索开放回答与量化变化如何汇合。它研究的是对话支持下的物理解题,而非共享阅读或阅读理解干预,不能据此推断儿童读写成效。

研究设计与方法

厄瓜多尔一所公立大学物理师范专业有97名具备一维运动学课程经历的潜在参与者,18名自愿者完成所有面授,占18.6%;年龄18—25岁、就读第三至第八学期,组成6个三人组。设计是单组固定顺序的前实验混合方法研究:先2小时概念激活,再4小时教师引导对话,最后4小时教师加AI对话。没有随机分组、反向顺序或延迟测量。

补充材料S4说明工具为机构提供的 Gemini,学生在Chromebook上使用角色、情境、指令、输出格式四部分提示,教师持续核验物理推理。具体底层模型版本未披露。教师提问没有被AI取代,两阶段均由小组形成书面共识答案。

量规有5项标准:原理理解、论证、例子/类比/反例、概念错误修正、表达组织;每项0—3分,每题最高15分(S3,第1页)。主要分析单位是6个小组,不是18份独立成绩;问卷及开放回答在个人层面收集。量规首轮整体CVI为0.944,题目—提问材料为0.886,修改后第二轮为1.00;评分采用共识而无独立评分序列,因此不能计算评分者ICC。

统计分析与建模

核心因变量是小组量规分,比较同组第二与第一阶段的配对差。总体差值的 Shapiro–Wilk 为 W=0.736、p=0.0148;结合有序量规和小样本,作者选择 Wilcoxon 符号秩检验,而不是把各题、各学生都视为独立观测。总体单尾检验报告 W=0、p=0.0312(第5页§III.A)。精确/近似计算、并列秩处理及总体有效非零差个数未完整说明,不能独立复算其单尾概率。

五个题目的双尾检验均使用非参数方法,以避免根据低功效正态检验反复换方法。表III的非零差个数依次为6、5、5、6、4;零差减少有效样本。各题中位差为1.0、2.5、2.0、3.5、1.0,p 值依次0.03125、0.06250、0.06250、0.03125、0.12500。没有报告多重比较校正,故题目层面的显著性属于未校正探索性发现,双尾本身不能替代多重检验控制。

模型没有协变量、随机效应或顺序效应调整;配对比较可消除部分组间固定差异,却不能分离AI、练习与累积学习。标准化效应量与置信区间未披露。共享的自我效能、负荷和动机主要呈现反应比例与均值;阶段专属的AI信任、有用性等不作同构前后比较。开放回答以主题分析整理,再用表IV的汇合矩阵区分一致、部分一致与无对应主题,不把质性叙述当作额外独立效应检验。

研究结论

作者报告总体每组平均增加8.3分,各组各题未观察到下降;题1与题4达到未校正0.05标准,题4中位数由6.5升至10.0(第5—8页、表III、图2)。其余题未显著不代表等效或无效;没有下降也不构成“无害”的统计证明。

自我效能同意比例由84.7%升至94.4%,内在动机由87.5%升至100%,认知负荷则从59.7%到65.3%,并存在异质反应(§III.B)。这些是问卷反应汇总,不能直接说相同比例的独立学生得到提升。结论部分使用“显著增加”措辞,但对应结果段未提供这些变化的配对检验统计量,应保留为描述性上升。

AI阶段开放回答中,44%提及概念清晰/有用,33%提及批判使用与核验,28%提及数学错误,22%提及提示依赖(§III.D)。这些可重叠主题解释了为何便利性与核验负担可以并存,并不证明哪一种机制导致分数变化。

讨论

发现的解释

作者讨论: 教师保持认识判断的调节者角色,AI补充解释和反馈,可能支持更清晰的论证;认知负荷并不必然降低,因为学生还需要检查AI输出。

总结者评议: 改善可能来自第二轮解题、教师持续反馈和答案组织,也可能包含AI支持。小组答案更完整不等同于每位成员都能独立迁移知识。

局限

作者讨论: 固定顺序、相同题目重复、小样本、混合分析单位及缺少评分者信度,限制因果与外推;需真正等价但不同的题目、平衡顺序及保持/迁移测量。

总结者评议: 摘要和方法称任务平行或同构,但结果§III.A与讨论明确说重复相同五题,程序表述存在不一致;据此应采用更保守的重复练习解释。共识评分的CVI反映内容适切性,不替代实际评分一致性,也不等于盲评。

研究贡献

作者讨论: SOCRATIC-IA展示教师引导、学科对话和生成式AI整合的可行路径,并强调对答案的概念控制。

总结者评议: 理论贡献是把AI置于可追问、可质疑的对话关系;方法贡献是并列成绩、体验与反思;实践价值在于设计教师监督的推理活动,而不是宣告AI已具有独立、普适的教学效应。

证据定位

  • Guerrero-Zambrano等(2026),出版论文,第2—5页§II、表I:设计、样本、程序与量规。
  • 第5—10页§III、表II—IV、图2—3:配对检验、成绩、问卷与主题分析;第11—12页§IV—V:顺序、重复题目与因果限制。
  • 补充材料S3:分析性量规,第1页:评分标准与范围;补充材料S4:提示结构,第1—2页:Gemini与教师监督。

2. 人工智能及其对高等教育学生学习投入的影响

原始标题: Artificial Intelligence and its influence on student engagement in higher education

作者与来源: Yongsheng Chen、Jing Dong、Guojuan Ji;Frontiers in Psychology,2026,2026年9月25日接受。原始来源。本文依据出版方已接受稿摘要,正式排版版本尚待发表。

研究问题与理论背景

在教师主导且公开提问可能带来社会压力的课堂中,低压力的AI对话能否支持学生更主动地参与学习?研究区分行为、认知、情绪与能动性投入:能动性不仅是完成任务,还包括主动提问、表达需求、影响学习过程。作者提出文化敏感的设计视角,但并未把中国大学生视为同质群体。

核心比较是苏格拉底式代理EduBot与常规论坛的学习投入变化。年级和既往GPA的调节分析明确属探索性;访谈提出的机制也是待检验解释,而不是已确证的中介路径。本研究不直接测量阅读理解或亲子共读。

研究设计与方法

混合方法准实验纳入中国4所综合性大学555名本科生,每校一门入门课程、各设两个平行班,共8班。在15周学期内,干预班278人连续12周使用嵌入学习管理系统的EduBot,对照班277人使用助教主持的论坛。该比较涉及完整AI教学方案与常规实践,不是只开关某一代理功能。

21题、四维投入量表改编自Reeve与Tseng(2011),三次施测,并结合系统日志、30名学生访谈及教师焦点小组。抽样与班级分配细则、纳排标准、三次测量的准确时点、脱落和各时点分析样本、量表在本样本的测量等值性均未在摘要披露。

统计分析与建模

作者同时采用考虑学生嵌套于课程班的线性混合效应模型,以及组别与时间的混合设计方差分析,主要关注 Group × Time 交互,即两组随时间变化是否不同,而非只比较干预组自身前后变化。

摘要未交代班级和学生层的具体随机截距/斜率、时间编码、协方差结构、估计器、缺失值处理、拟合比较及自由度校正。只有8个班,聚类层面的不确定性尤其重要;555名学生不能替代足够多的独立班级。报告的交互偏效应量与后测标准化组间差属于不同统计量,不能互相替代。

多重检验使用Holm调整,四维交互均报告调整后 p\leq0.001。干预组内,以EduBot会话次数预测后测投入,并调整基线与协变量;协变量清单、回归系数与置信区间未披露。使用频率也可能反映原有动机,不能把这一关联视为随机剂量效应。访谈采用主题分析,编码程序与一致性细节未披露。

研究结论

出版方摘要给出的组别×时间交互及后测差分别是:

  • 行为投入:\eta_p^2=0.043,后测 d=0.71。
  • 认知投入:\eta_p^2=0.032,后测 d=0.55。
  • 能动性投入:\eta_p^2=0.054,后测 d=0.57。
  • 情绪投入:\eta_p^2=0.012,后测 d=0.34。

能动性具有最大的交互偏效应量,但行为投入的后测 d 更大,因此“能动性增益最突出”必须注明所指指标。各效应置信区间及标准化分母未披露。探索分析显示一年级学生能动性增益较大、既往GPA较低者认知增益较大,但不能据此认定已经缩小教育差距。

访谈提出非评判性互动空间、持续投入的支架和时间灵活性三种可能机制。总体结果是EduBot方案与较高投入相关,不能把关联归因于某项单独功能,也未证明认知能力或成绩同步提高。

讨论

发现的解释

作者讨论: 低评价压力的对话可能使学生更愿意主动表达;设计AI时应考虑课堂参与规范和文化背景。

总结者评议: “随时可用”和“可以反复追问”是不同机制。两者需要独立操纵或过程分析,访谈主题本身不能分解其贡献。

局限

作者讨论: 8个班比较的是整套AI方案与通常教学,无法识别单个设计成分的作用;公平性潜力只是谨慎推论。

总结者评议: 班级分配、教师/课程差异和使用自选择仍可能混杂结果。重复自陈量表也不等于学习成果,摘要未提供的统计细节限制了对稳健性的判断。

研究贡献

作者讨论: 将真实课程中的持续AI对话与四维投入相联系,为文化敏感的教育AI设计提供线索。

总结者评议: 理论价值在于重视学习者能动性,方法价值在于组合重复测量、日志与访谈,实践价值在于提出值得进一步试验的支持方式;边界是准实验关联而非已分离的AI因果效应。

证据定位

  • Chen、Dong与Ji(2026),出版方文章页,Abstract:样本与12周设计、四维量表、混合模型、交互效应量、后测差、探索调节与访谈主题。
  • 同页 Accepted:2026年9月25日;摘要未列模型表、效应区间或页码,不能据其推断未报告的模型设定和样本流程。

文献清单

  • 生成式人工智能介导的苏格拉底式对话对职前物理教师运动学批判性思维的影响——教师监督下的推理支架与固定顺序的因果限制。
  • 人工智能及其对高等教育学生学习投入的影响——持续对话支持、四维投入及班级准实验的解释边界。