GenAI 正在如何改变金融研究?一份系统性综述(下)
温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。作者宗景辉西北大学邮箱jh_zong2023163.comTitle: GenAI 正在如何改变金融研究一份系统性综述中Keywords: 生成式人工智能, GenAI, 大语言模型, LLM, 金融文本分析, 综述, ChatGPT编者按本推文主要翻译自下文略有改动特此感谢Source:Mo, H., Ouyang, S. (2025). (Generative) AI in Financial Economics.Journal of Chinese Economic and Business Studies, 23(4): 509-587. Link, PDF, Google.查看系列推文GenAI 正在如何改变金融研究一份系统性综述 (上、中、下)导言Mo Ouyang (2025) 这篇综述论文旨在为国内金融实证研究者提供一份系统的 AI 与金融经济学交叉领域应用指南。该综述全面梳理了人工智能 (特别是生成式 AI 和大语言模型) 在金融经济学六大核心领域的应用进展、方法论创新及面临的挑战。本系列分为 [上、中、下](GenAI 正在如何改变金融研究一份系统性综述) 三篇。上篇聚焦 AI 时代背景与 GenAI 的三重角色中篇将深入探讨公司金融、资产定价、家庭金融、劳动经济学等应用前沿下篇则讨论风险挑战与未来方向。本文 (下篇) 将重点介绍两个方面风险与挑战GenAI 在金融研究中的方法论陷阱以及 AI 融入金融系统引发的系统性风险与监管应对讨论与未来方向打开黑箱、LLM 作为经济主体、人机互补、因果推断以及 AI 的长期结构性影响。文中提及的文献已在推文 255 篇论文GenAI 在金融领域的各种应用 中列出。1. 风险与挑战AI 融入金融系统具有变革潜力但也带来重大挑战。1.1 GenAI 在金融研究中的方法论挑战将大语言模型 (LLM) 应用于金融研究和金融实务时研究者需要审慎对待以下几类方法论陷阱。1.1.1 幻觉与错误首要问题是 AI 幻觉即以高度自信的口吻输出虚假或凭空编造的内容 (Ji et al., 2023; Zhang et al., 2023这一缺陷在对准确性要求极高的金融领域尤为致命。Kang Liu (2023) 发现未经专门调优的通用 LLM 在金融任务中幻觉频发例如不准确地总结财务报告或编造统计数据。缓解策略Karbasi et al. (2025) 提出可通过同时使用正确示例和明确标注的错误示例来训练幻觉检测器。Ji et al. (2023) 建议两类缓解路径——数据层面 (如构建高质量数据集、引入外部知识库辅助输入) 和模型层面 (如调整架构、引入强化学习和可控生成)但每种方法在准确性、流畅度和泛化能力之间存在取舍。Li et al. (2024) 引入多智能体协作方法让多个 LLM 相互验证以减少单一模型的幻觉。Fang, Li, Lu (2025) 在金融经济学研究中展示了一套实用策略将复杂问题拆解为子问题、提供精确定义和反例、要求模型在回复中附上原文依据和置信度评分并通过词云分析、人工抽检和时间序列交叉验证来核实结果。1.1.2 前瞻偏差与过拟合金融数据天然具有时间序列特征因此前瞻偏差是一个持续性陷阱。在海量互联网文本上训练的 LLM 可能在预测任务中无意间利用了未来才发生的信息而 LLM 极高的模型灵活性也加剧了过拟合的风险。前瞻偏差的识别与隔离Glasserman Lin (2023) 和 Sarkar Vafa (2024) 提出了隔离时间信息的稳健方法但同时指出仅验证模型在知识截止日之后数据上的表现是不够的。Ludwig, Mullainathan, Rambachan (2025) 指出许多闭源模型通过持续微调可能将未来知识无意中泄漏到对过去语境的回答中。金融研究中的具体做法Breitung Müller (2025) 通过隐去公司名称等标识信息防止模型利用已知的公司未来表现。Jha et al. (2024a) 采用子样本分割方法严格隔离不同时期的训练和测试数据。Gao, Xiong, Yuan (2024) 通过替换数据中的日期信息来检验模型究竟依赖时间标记还是文本内容进行预测。1.1.3 可复现性不同模型版本、 API 接口、提示词 (prompt) 的细微改动都可能导致输出结果大幅波动构成研究可复现性的重大障碍Mirzadeh et al. (2024) 在 25 个模型上开展大规模测试发现改变题目中的数值或添加无关从句等微小改动即可导致高达 65% 的准确率下降表明当前 LLM 严重依赖表面的模式匹配而非真正的逻辑推理。Ross, Kim, Lo (2024) 和 Ouyang, Yun, Zheng (2024) 表明 LLM 的经济决策行为高度取决于其微调方式不同版本可能产生截然不同的结果。研究者应将生成温度 (temperature) 等随机性参数设为零作为基准也可尝试将历史对话摘要回馈至提示、或借助外部知识库来增强一致性但这些方法并非万无一失。温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。