Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Syn...
一、文章主要内容总结该研究聚焦于大型语言模型(LLMs)在编程任务难度评估中的可信度问题,通过对比GPT-4o与可解释的LightGBM集成模型在LeetCode题目难度分类(Easy/Medium/Hard)上的表现,揭示LLM作为难度评估器的核心缺陷,并通过合成问题生成实验进一步探究其内部难度判断逻辑。研究背景:LLMs在代码生成、辅导与评估中应用日益广泛,但在结构化的编程题目难度预测等任务中的表现尚未被充分探索。现有自动难度评估方法多依赖数值特征(如输入规模、通过率)和文本特征,且可解释性模型表现稳定。实验设计:数据集:1825道带官方难度标签的LeetCode题目,包含文本描述(TF-IDF特征)和数值元数据(输入规模、通过率等)。模型对比:GPT-4o(仅输入文本描述,移除数值元数据)与LightGBM集成模型(同时输入文本和数值特征)。补充实验:让GPT-4o生成“Hard”级别合成题目,再由其自身重新分类,验证其难度判断的一致性。核心结果:性能差距:LightGBM准确率达86%,而GPT-4o仅37.75%,且GPT-4o存在强烈的“低估难度”偏差(83.38%的真实Hard题目被标为Easy)。特征影响:SHAP分析显示,数值约束(输入规模、通过率)是LightGBM区分Hard题目的关键,而GPT-4o忽视此类信息。一致性问题:G