中山大学林建浩团队|| 基于AI大语言模型的叙事资产定价研究

发布人:牟泽阳

作者:

樊嘉诚:中山大学岭南学院

林建浩:中山大学岭南学院

李宗余:广发证券股份有限公司

文章刊发:《经济学(季刊)》2026年第3期

 

摘要:本文利用 BERT 大语言模型提取新闻文本信息, 并通过SparseIPCA 方法构建叙事资产定价模型。实证发现状态变量显著反映宏观预期、产出及股市收益, 揭示了新闻叙事的经济信息价值。相比传统的股票特征因子, 基于文本数据的叙事因子能更好地解释资产异象, 并具有更强的样本外策略表现。研究进一步证明了大语言模型的定价效果优于传统的 LDA 主题模型, 并探索其在可解释性、高频因子挖掘及与传统因子联合应用方面的潜力。

关键词:横截面资产定价,大语言模型,文本分析

1.研究背景

     理解资产回报的横截面差异,是资产定价研究的核心议题。早期研究多以宏观经济变量作为状态变量的代理,此后基于股票特征构建的因子模型逐渐成为主流,并衍生出数量庞大的定价因子。近年来,Shiller(2017)提出的“叙事经济学”为理解资产价格变动提供了新视角:经济叙事传播迅速,会影响微观主体的预期与决策,进而作用于资产价格。新闻报道是经济叙事的重要载体,Bybee et al.(2023)已尝试将新闻叙事引入资产定价框架。

     然而,新闻文本高维且非结构化,从中提取对资产定价有效的信息长期面临方法上的制约。传统文本分析方法(如 LDA 主题模型)主要依赖主题词频,难以刻画上下文语义;以 BERT 为代表的 AI 大语言模型则能够把握上下文与复杂语言关系,为提取新闻中的叙事信息提供了新的技术手段。在此背景下,本文尝试回答:新闻文本中的经济叙事能否被识别为影响资产价格的状态变量与定价因子,以及基于大语言模型构建的叙事因子相比传统方法是否具有增量价值。回答上述问题,既有助于厘清新闻信息进入资产价格的渠道,也为人工智能在金融领域的应用提供实证依据。

2.研究方法和结果

     本文使用 2008—2021 年七家主流财经报纸的新闻文本,借助BERT 大语言模型生成文档级嵌入向量,构造日度“叙事新息”;在此基础上,采用 Sparse IPCA(Bybee et al.,2023)方法,从高维叙事信息中提取少数潜在状态变量与可交易的叙事因子(记为 NF-LLM)。作为对照,本文同时基于 LDA 主题模型构建叙事因子(NF-LDA),并与传统的 Fama-French-Carhart因子(FFC)和统计主成分因子(PC)进行比较。

     基准结果发现:第一,提取的状态变量具有明确的经济含义,与消费者信心指数同向变动,并能显著预测未来的产出、消费、投资与通胀,符合跨期资本资产定价理论(ICAPM)的预期。第二,在对 96 个股票市场异象的检验中,叙事因子模型的定价误差显著低于传统模型,对交易摩擦、动量与流动性等传统因子难以解释的异象改善尤为明显。第三,在样本外交易策略中,最优 NF-LLM 模型的年化夏普比率达到 0.95,最优传统 FFC6 模型仅为 0.27,前者约为后者的 3.5 倍;在控制 FFC6 因子后,NF-LLM 三因子与五因子模型仍分别获得 0.84% 与 1.20% 的年化超额收益,表明叙事因子包含显著的增量信息。

     机制与拓展分析进一步表明:(1)大语言模型优于传统主题模型。无论在定价精度还是策略表现上,基于 BERT 的 NF-LLM 均稳定优于基于 LDA 的 NF-LDA,原因在于前者更能捕捉上下文语义、复杂语言关系与不同长度的文本。(2)叙事的影响渠道以现金流信息为主。叙事主题与现金流信息的相关性高于贴现率信息,表明新闻主要通过改变投资者对未来基本面的预期来影响资产价格。(3)结论稳健且具有可解释性。在剔除媒体写作风格、改变 LDA 主题数量后,结论依然成立;叙事因子可对应到“风险管理”“经济发展”“货币政策”等可识别主题,并在周度高频以及与传统因子联合使用时同样有效。

3.研究贡献和政策启示

     本文的主要贡献体现在三个方面:第一,本文将AI大语言模型系统性地应用于中国 A 股市场的横截面资产定价,打通了从非结构化文本到经济信息、再到定价因子的完整链条。第二,本文以实证证据表明新闻叙事蕴含可被定价的经济信息价值,为叙事经济学提供了来自资产定价领域的量化支撑,并系统比较了大语言模型与传统主题模型在定价上的差异。第三,本文展示了大语言模型在可解释因子挖掘、高频信号提取以及与传统因子融合等方面的应用潜力,相关方法可推广至其他文本驱动的金融实证研究。

     本文的政策启示主要有两点:第一,应加大对“人工智能 + 金融”的支持力度,引导金融机构与高校科研院所加大研发投入、深化产学研协同,推进经济大模型的研发与应用,同时注重提升人工智能模型的可解释性与透明度,确保其在金融实践中的安全性与合规性。第二,在信息传播日益高速的环境下,金融市场的叙事驱动效应愈发突出;我国资本市场以散户投资者为主,对经济叙事较为敏感,易因情绪波动产生非理性交易,从而加剧系统性金融风险,监管机构应积极利用人工智能技术,提升监管的精准度与前瞻性,防范因信息失真导致的市场失序。

     在此基础上,未来研究可结合BERTopic、注意力权重可视化等可解释性机器学习方法,更准确地识别驱动资产定价的叙事信息,并采用更严谨的计量方法进一步增强结论的稳健性与可推广性。

 

论文信息

樊嘉诚,林建浩,李宗余.基于AI大语言模型的叙事资产定价研究[J].经济学(季刊),2026,26(3):790-810.