AI参加高考,文科一本理科二本,未来能超越吗?

AI高考成绩揭晓
AI参加高考的成绩近期引起了广泛关注。在上海人工智能实验室旗下司南评测体系OpenCompass的测试中,AI在文科和理科考试中的表现呈现出了明显的差异。
文科成绩较为出色
在文科考试中,阿里通义千问大模型以546分的成绩成为“文科状元”,展现出了在语文、历史、地理、思想政治等科目上深厚的知识储备和理解能力。这一成绩超过了一本线,表明AI在文科知识的掌握和运用方面具有一定的优势。

理科表现稍逊一筹
在理科考试中,AI的整体表现则相对较弱。虽然前三甲的理科成绩超过了二本分数线,但与文科相比仍有差距,体现了大模型在数理推理能力上普遍存在的短板。
模型得分与录取线对比
评测团队选取了河南省录取批次线作为参考,对比了大模型得分与对应分数线。结果显示,表现最优的三个大模型文科成绩过一本,理科超二本,而其他大模型文理科成绩均未达到二本线标准。
纯文本题目与带图题目表现差异
在评测过程中,纯文本题目由大语言模型作答,平均得分率可达64.32%。而面对带图题目,得分率仅有37.64%,这表明在图片理解和运用能力方面,所有大模型均存在较大的提升空间。
AI答题的不足之处
在答题过程中,AI也暴露出了诸多问题。比如,在作答主观题时,往往无法完整理解题干,不明白代词指向,导致答非所问。在解答数学题时,解题过程机械且逻辑性差。对于物理、化学实验的理解肤浅,无法准确识别并运用实验器材。还会伪造虚构内容,编造看似合理但实际不存在的诗句,或在存在明显计算错误的情况下不反思,随意给出答案。
未来的发展与提升空间
尽管目前AI在高考中的表现存在局限性,但随着技术的不断进步和再训练,它是否能够达到顶尖高校的录取线水平,仍值得期待。不过,从目前的情况来看,相对于人类考生,AI在逻辑推理和知识灵活应用方面仍有很长的路要走。
阅卷老师的看法
理科数学老师指出,大模型做题总体感觉很机械,基础公式记忆能力优秀,但无法灵活使用。地理老师认为,大模型在基础知识点考查上出色,但面对深入分析或推理问题存在偏差和遗漏。物理老师发现,大模型很多无法识别题目意思,大题步骤冗杂且逻辑混乱。
AI在高考中的表现为我们提供了一个观察其发展水平的窗口,也让我们对未来的教育和技术发展有了更多的思考。

相关问答
AI高考评测是如何进行的?
评测采用3(语数外)+3(理综/文综)的形式,纯文本题目由大语言模型作答,带图题目由对应团队开源的多模态大模型回答。
AI在文科考试中的优势是什么?
AI在文科考试中展现出对知识的全面覆盖,在基础知识点考查上表现出色。
AI在理科考试中的不足有哪些?
AI在理科考试中存在数理推理能力短板,解题过程机械,逻辑差,无法灵活运用知识。
为什么AI在图片理解方面表现不佳?
目前AI在图片理解和运用能力上仍存在较大提升空间,技术尚未完全成熟。
AI高考成绩能代表其真实水平吗?
目前AI高考成绩反映了其一定的能力,但也存在局限性,不能完全代表其真实水平。
未来AI在高考中的表现会怎样?
随着技术进步和再训练,AI在高考中的表现可能会提升,但仍面临诸多挑战。

