花卷铺

花卷铺

Reading|2026-09-24 阅读研究日报

5
2026-09-24

1. 面向英语作为外语学习者的人工智能辅助口语练习:与传统教师主导练习相比对焦虑、愉悦和参与度的影响

原始标题:AI-assisted speaking practice for EFL learners: effects on anxiety, enjoyment, and engagement compared to traditional teacher-led practice
作者与出处:Peiyun Liu、Jie Song;Humanities and Social Sciences Communications,2026,Article in Press。
原始来源:https://doi.org/10.1057/s41599-026-09016-8

研究问题与理论背景

口语需要即时组织语言,并面对他人评价,因此可能比可反复修改的书面任务更易引发焦虑。积极心理学认为,减少负面情绪和培养愉悦并不是同一件事。作者以控制—价值理论解释聊天机器人可能通过增加自主性、降低评价威胁来减轻焦虑,以拓展—建构理论解释积极情绪如何支持探索和参与。

研究问题是:人工智能辅助与教师主导的口语练习,在口语焦虑、外语学习愉悦及二语参与度上有何差异?这些是同时测量的三个结局,并非已经验证的情绪中介链。论文没有以纵向中介模型或密集时间序列检验“愉悦降低焦虑、再提升参与”的动态机制,也未报告预注册的确认性分析计划。

研究设计与方法

2025 年春季,浙江一所综合大学的两个大一自然班参加十二周准实验。两班起初分别有 41 和 42 人,剔除不完整或无效问卷后,方法和表 1 报告人工智能组 35 人、对照组 36 人,年龄 18—19 岁;摘要却将两组人数写为 36 和 35,存在互换。两班按入学测试设置为平行班,但不是随机分配条件。

两组使用相同教学大纲、六个主题,课堂均包含教师讲授、口语练习和教师总结。人工智能组接受使用培训后,以豆包进行角色扮演、主题对话,并获得即时反馈;对照组通过同伴角色扮演、成对讨论和教师指导完成平行任务。因此比较的是两套互动安排,不是单独隔离某一种语言模型功能。

前后测分别采用 18 题口语焦虑、21 题外语愉悦、24 题二语参与度量表,均为五级反应,以题目总分分析;量表经过中文翻译与回译。参与度包含行为、情感、认知内容,但分析未分别估计维度效应。没有客观口语表现测验、干预结束后的延迟追踪或明确的每人实际练习剂量记录。

统计分析与建模

SPSS 27.0 中对每个后测总分分别拟合单因素 ANCOVA,以教学条件为预测因素、相应前测总分为协变量,检验调整后的组间差异。另以独立样本检验描述前测差异、Q–Q 图检查分布,并在各组内实施配对检验。模型报告偏 η²,组内变化报告 Cohen’s d;两种效应量对应不同比较,不能将组内 d 当作人工智能相对对照的净效果。

缺失或无效回答通过排除处理,未报告插补或对排除选择性的敏感性分析。正文展示原始分布 Q–Q 图,但没有充分报告 ANCOVA 的残差诊断、回归斜率同质性、组内相关处理或多重结局校正。前测差异不显著也不构成等效性证明。

总结者评议:研究只有两个班且每种条件各一个班,班级与教学条件完全重合。个体层 ANCOVA 没有班级随机效应或聚类稳健标准误,即使控制前测,也无法区分班级文化、同伴组成等差异与干预作用。三个结局各自的 ANCOVA 是并列结局检验,不是对三者交互动力学的检验。

研究结论

表 5 显示调整前测后,口语焦虑的组效应 F 为 6.77,自由度为 1、68,p 为 0.011,偏 η² 为 0.09;作者解释为人工智能组焦虑较低。愉悦的组效应 F 为 1.52、p 为 0.222,参与度 F 为 0.01、p 为 0.930,均没有显著组间差异。论文未给出调整后的均值差及其置信区间,所以不能由偏 η² 直接换算出调整后的原始分数收益。

人工智能组焦虑从 63.20 降至 58.80,配对差值区间为 [3.19, 5.61],组内 d 为 1.25;愉悦与参与度也有显著组内增加(表 6)。但“人工智能组显著、对照组不显著”本身并不等于两组变化显著不同,更不能据此宣布人工智能对所有结局均优于教师教学。

对照组存在额外报告不一致:表 3 的焦虑、愉悦、参与度前测均值为 62.39、77.72、80.33,表 7 却是 62.74、76.89、80.26;前者列 36 人,后者配对检验自由度均为 34。论文没有清楚解释是否使用不同完整配对样本,因此两套描述和变化量不宜强行合并。

讨论

发现的解释

作者讨论:私人化、非评价性的人工智能对话可能提高控制感、降低社会评价威胁,并通过积极反馈形成情绪支持。总结者评议:这些是理论解释,不是已测量并估计的中介机制。愉悦和参与度未出现显著净优势,提示好的同伴与教师活动本身也可能提供支持;但不显著不能证明两种安排等效。

局限

作者讨论:单校小样本、自然班分配、自陈结局和十二周观察限制因果与推广判断,未来需更大规模随机试验及长期表现测量。总结者评议:人数互换、对照组前测与自由度差异、班级混杂降低估计透明度;多个结局和组内检验还需预先确定主要结局。文中较高均值并不足以单独证明存在天花板效应,必须结合量表上限附近的实际分布判断。

研究贡献

作者讨论:人工智能更适合作为教师教学的补充,需有提示语和反馈解释指导。总结者评议:理论价值是把焦虑与积极情感分开衡量,方法价值是用相同课程内容建立现实课堂比较,实践价值是提示低压力口语练习的可能用途;当前支持的是有条件的焦虑关联,不是口语能力、阅读理解或全面学习参与改善的证据。

证据定位

  • 已接收提前发布稿:第 7 页样本及表 1;第 8—9 页测量与程序;第 10、12 页表 3、4;第 14 页表 5;第 16—17 页表 6、7;第 18 页研究局限。
  • 出版页面:Article in Press;摘要人数与方法表格的差异见第 1、7 页。

2. 通过教师仪表板与数字化个性化学习提升读写和数学能力:肯尼亚早期教育中的 A/B/C 试验

原始标题:Enhancing literacy and numeracy through teacher dashboards and digital personalised learning: an A/B/C test in Kenyan early years education
作者与出处:Chen Sun、Louis Major、Rebecca Daltry、Lazar Obradovic、Aidan Friedberg;Educational Technology Research and Development,2026。
原始来源:https://doi.org/10.1007/s11423-026-10703-1

研究问题与理论背景

数字化个性化学习不只涉及为儿童推荐内容,也涉及教师如何理解系统信息并分配有限设备。列表排名提供相对位置,而“还需练习”等分组标签可能更直接引出教学行动。作者据此询问:仪表板设计是否影响设备使用、早期读写与数学表现,以及教师对算法排名准确性的判断?

研究由教师共同设计、界面试测和大规模比较衔接而成,关注真实课堂中的实施。三个研究问题有明确测量指标,但设备使用只是教师行为改变的间接指标;“分组提示改变教师决策,进而改善学习”的完整路径并没有被直接测量或作为中介模型检验。

研究设计与方法

2024 年 1 月 24 日至 4 月 5 日,4,487 所肯尼亚学校开展十周三组试验,涵盖学前至二年级,通常对应 3—8 岁,但系统未收集实际年龄。学校唯一标识经哈希后分为无仪表板、列表仪表板、分组仪表板三组。所有学校使用相同 EIDU 个性化学习系统,因此研究估计的是不同教师界面在已有数字学习之上的增量影响,不是数字学习相对于无技术教学的效果。

每班共享至多两台低价 Android 设备,内容与肯尼亚课程对齐。个体学习顺序由 LSTM 根据表现历史预测,算法可离线运行;观察到每次练习平均 6.19 分钟。两种教师仪表板使用相同能力预测数据,一种按个人得分排序,另一种划分“练习足够”“继续练习”“需要更多练习”。

使用分析包含 4,487 校;测验分析剔除连续四题超时、被视为未参与的记录后,包含 4,155 校、68,666 名儿童,其中 67,025 名为学前儿童。九类测验来自 EGRA、EGMA、MELQO,包括四项读写、五项数学;同一儿童同类测验重复时取最后成绩。教师评价样本为 1,184 校、5,576 名儿童,共 25,112 次评分,不能把评分次数当作独立教师或儿童人数。

统计分析与建模

学校月度使用小时数分别在干预前、后拟合混合模型,界面组别为固定预测因素,学校作为随机效应,处理一校多个月记录的依赖。干预前数据来自 2023 年 5—10 月的 4,132 校,干预后为 2024 年 1—4 月,新增学校也接受随机分配。论文未报告完整估计方法、时间协方差结构、组别系数区间或组别与时期交互,因此这不是明确展示的差分中差分分析。

学习成绩以答对比例表示。作者因所有测验的 Shapiro–Wilk 检验拒绝正态性、其中一项存在异方差,转而采用 Kruskal–Wallis 组间检验。总结者评议:非参数检验并不会自动处理学校聚类;论文没有报告成绩的聚类调整,而随机化发生在学校层面,因此个体秩检验的显著性需要谨慎看待。原始结局非正态也不必然要求放弃层级建模。

教师“是/否/不确定”评分用卡方比较,事后比较作 Bonferroni 调整。评分可重复来自同一儿童及学校,文中没有充分说明是否修正这些依赖;按性别、学科与分组比较属于进一步分析,不能单靠显著差异判断偏见来自算法还是教师。

附录 A 的 Scolreks 是仪表板能力估计模型,须与学习顺序的 LSTM 区分。原预测式为:

\hat{y}=\tau(m+s\cdot d\cdot w),\qquad \tau(x)=\min(\max(0,x),1).

其中 m、s 是学习单元历史均值和标准差,d 是儿童既往标准化表现的平均偏移,w 是学习得到的权重,截断函数限制预测在 0—1。模型结合最近实际成绩、未做单元的预测和接触程度构成能力分,再按各子领域历史四分位阈值分组。它是界面生成算法,不是试验效果的统计模型;教师认可也不是独立客观校准指标。

研究结论

干预后分组仪表板学校平均每月使用 82.55 小时,列表为 76.07,无仪表板对照为 75.94;相对分组界面,另外两组的 Z 分别为 −4.04、−4.19,p 均小于 0.001(第 16 页表 1)。这些是学校汇总使用量,不是每名儿童增加的时长;各组干预前月均值更高,也不能把横向差异写成三组都随时间增加。

九个测验中仅字母音和词音短测验达到显著组间差异。字母音三组答对比例依次为 0.191、0.182、0.182;词音为 0.229、0.224、0.226(第 17 页表 2)。相应 H 为 56.62、14.67;其余七项含全部数学测验不显著(表 3)。差异的绝对幅度较小,论文未提供聚类调整后的效应区间,不能只凭大样本显著性称为巨大读写收益,也不能将数学不显著当作没有任何效果。

教师对分组仪表板表示“准确”的比例为 58.8%,低于列表的 64.1%;两种设计预测来源相同,却获得不同认可(表 4)。这说明可行动性与主观可信度可能并不同步,不证明列表算法在客观测量上更准确。

讨论

发现的解释

作者讨论:具有行动指向的分组标签可能帮助教师分配设备,但教师也可能不同意“练习足够”的措辞;这能解释使用增多而认可下降。总结者评议:缺少课堂观察和完整路径分析,这些仍是解释假说;少数读写子任务的差异也不能代表整体阅读理解或长期学习迁移。

局限

作者讨论:年龄、班级规模、设备数量未充分记录,教师自愿评分有选择性,软件日志不能直接呈现课堂行为。总结者评议:聚类和重复评分依赖是比非正态更关键的推断问题。表 1 干预前列表组 p 为 0.369,而正文写 0.396,Z 值还有排版异常;这不影响识别报告差异,却不应被擅自纠正。多项测试、不同任务样本量、只取最后成绩与参与排除规则,也限制对统一平均学习效应的概括。

研究贡献

作者讨论:真实环境 A/B/C 试验为低中收入地区教师端仪表板提供大规模比较证据。总结者评议:理论上区分信息理解、行动与学习,方法上把界面版本随机分配嵌入日常系统,实践上强调教师共同设计和标签措辞;进一步推广仍需聚类适当的估计、独立能力测验及定性观察,不能以软件优化取代对课堂情境的理解。

证据定位

  • 期刊论文:第 8—12 页系统、界面与分配;第 13—16 页结局、分析和方法局限;第 16—19 页表 1—7;第 20—23 页讨论。
  • 论文 PDF:附录 A,第 23—25 页 Scolreks 预测式、接触程度调整及分组阈值。

文献清单

  1. 人工智能辅助与教师主导口语练习的焦虑、愉悦及参与度比较
  2. 肯尼亚早期教育教师仪表板与数字化个性化学习 A/B/C 试验