论文链接:
https://aclanthology.org/2026.acl-long.1273/
github链接:
https://github.com/aolaoban/Graph-Bounded_Financial_Reasoning.git
发表会议:ACL 2026
1. 动机
大型语言模型(LLMs)在金融文本处理任务(问答、情感分析等)上表现出色,但将其文本理解扩展至金融数值推理仍是一个未解决的难题。不同于开放式文本生成,金融数值推理要求严格遵循领域专属逻辑和精确的证据基础,任何细微的数值偏差都可能导致最终推断失效。
图1:LLM金融数值推理中两种失效模式的实例
图1用一个具体的 ROE 增长率计算案例呈现了两类失败模式:
(1)证据边界模糊
当上下文信息不完整时,LLM 对序列的补全偏好会驱使模型凭空捏造看似合理的数值来填补信息缺口。例如图1(a),模型幻觉了一个根本不存在的2023年初始股本 = $1900来强行完成计算,产生了错误的 ROE Growth = 3.9%。
(2)推理结构复杂性
金融指标天然形成具有层级依赖关系的有向无环图(DAG)结构,而 Transformer 架构的本质是顺序建模范式,存在结构性不匹配。没有精确公式定义时,LLM 往往会分解错误,例如图1(b),将 ROE 公式错误地套用为 净利润/总股本,而非正确的 净利润/平均股本,最终得出错误结果 ROE Growth = 4.5%。
现有方法几乎都针对答案生成优化,缺乏对安全弃权的机制设计:即当证据不足时应该说无法回答,而不是强行给出幻觉答案
因次,本文提出了一种神经符号的图约束金融推理框架GBFR,将大语言模型的语义泛化能力与金融指标知识图谱(FMKG)的领域语义和结构约束相结合。通过验证所有逻辑路径,能够完成正确的金融数值计算并且区分真实的数据缺失来安全地拒答问题。
2. 贡献
(1)构建了一个形式化为 DAG 的金融指标知识图谱(FMKG)。
(2)设计了一种并行的图约束推理框架,并行探索多条推导路径。
(3)通过完整遍历所有可能的推导路径、别名映射和派生依赖,只有在穷举所有可能路径后确认证据确实不存在,才输出弃答符号,将输出失败转变为一种可信的安全输出。
3. 方法
图2:GBFR框架图
(点击图片放大查看)
GBFR 框架由三个部分构成,整体逻辑如下:
(1)预先构建好 FMKG,将金融领域的计算逻辑固定为一张可查询的符号图谱,作为所有推理的结构性基座。
(2)当一个金融查询进来时,先由查询分析算子将自然语言问题解析成一个结构化执行计划,识别出推理类型、目标指标、操作数以及各种约束条件(时间范围、实体范围、货币单位等)。接下来,框架对每个子目标启动并行解析流程:首先由证据寻找算子在文档中直接查找目标指标的数值,如果找到则直接返回;如果找不到,则输出 ⊥ 并触发指标分解算子,在 FMKG 中检索该指标的所有候选推导路径,并对每条路径的子节点递归地并行解析。每条成功实例化的路径,最后由程序执行算子生成并运行 Python 代码完成数值计算。
(3)所有候选路径得到数值结果后,跨路径验证机制对每条路径进行证据核查与逻辑审查。只有通过审查的路径才被认为有效,通过投票聚合确定最终答案;若没有任何路径通过验证,系统输出安全弃答 ⊥。
3.1 FMKG
金融指标天然存在层级依赖结构,复杂指标由其他变量计算得出,且同一公式可通过代数变形求解不同变量。为使推导过程有明确定义并对推理施加结构约束,本文将 FMKG 形式化为一个有向无环图(DAG),包含以下核心要素:
节点:
• 原子节点:不可再分的基础概念(如股票价格),是依赖图中的终止单元,只能从文档中直接提取
• 派生节点:由计算逻辑定义的复杂指标(如 ROE),需通过公式推导得出
边与公式:有向边(d,a)表示节点 d 在结构上依赖节点 a。每个派生节点关联一组候选公式包含具体的计算函数公式与所需的子节点集合。
别名映射:每个节点映射到一组语言别名, 为符号节点与非结构化文本之间的对齐桥梁,用于解决证据检索中的语义歧义问题。
FMKG构建主要分为三个方面:多元数据获取 → 术语消歧 → 混合验证,并附有持续更新工作流。
• 数据获取
函数库:整合 FinanceReasoning 数据集附带的函数库,作为核心指标的基础分类框架。
百科全书检索:爬取 Wikipedia、Investopedia 等权威金融百科,主要目的是横向扩展节点数量并丰富别名映射。
非结构化文本抽取:从金融教材和 CFA/CPA 备考材料中抽取长尾领域知识,覆盖主流百科未收录的小众指标和行业实务变体公式。
• 术语消歧
解决数据合并时的术语冗余与语义歧义(如 Net Income vs Net Profit)。分两步进行:
语义聚类:将所有术语转化为向量,用聚类算法将语义相近的术语自动归组
LLM 语义验证:对每个候选同义词簇,由 LLM 严格判断簇内术语是否指向完全相同的金融概念,验证通过则合并为单一节点,并自动聚合别名、公式和代码实现
• 混合验证
首先,利用GPT - 5对提取的字段进行验证,自动补全缺失的属性,如对公式表达式进行标准化,并为派生节点生成可执行的Python代码。领域专家对聚类后的节点和LLM生成的内容进行审查,以纠正公式依赖中的错误和解决边的情况。
每个派生节点包含别名、定义、多候选公式及对应 Python 代码;原子节点仅含别名与定义。以 Cost of Sales 为例:
图3:节点的实例:销售成本
图4:从FMKG中提取子图的可视化
3.2 原子算子
算子一:查询分析算子
给定文档D和查询Q,运算符将查询映射到特定的推理类别(直接检索、算术计算、比较推理、统计聚合、时间推理),并解析所需的计算逻辑;子目标及其约束条件(时间范围、实体范围、货币/规模/单位的属性)和精度。
算子二:证据寻找算子
利用 FMKG 中的别名映射,在文档 D 中精确定位满足约束 C 的数值证据。否则必须标记为缺失(⊥)。若返回 ⊥:对于原子节点则直接终止该路径;对于派生节点则触发指标分解算子分解。
算子三:指标分解算子
在 FMKG 中通过双向搜索检索候选推导路径:主要为向下遍历(获取通过子节点的分解路径),辅以有限的向上探索(1-hop 父节点,用于公式的变形求解)。每条路径包含符号公式和所需子节点集合,交给程序执行算子执行。
算子四:程序执行算子
将符号路径与验证过的证据值转化为可执行的 Python 程序,在沙盒环境中运行,获得确定性的数值结果 y。若任何输入值为 ⊥,则执行停止并传播 ⊥,不产生任何中间幻觉。
4. 实验
4.1 反事实样本生成
由于现有基准模型存在正向偏见问题(即模型倾向于强行给出答案),本文设计了系统性的反事实样本生成流程。
三类扰动策略:
• 实体突变:将查询中的目标公司替换为语料库中出现的无关竞争对手
• 时间偏移:修改财务年度(如将"2023"改为"2022",对应数据在文档中不存在)
• 指标替换:将目标指标替换为语义相似但不同的指标(如 ROE → ROA)
生成流程:先按 10% 比例从各数据集中分层采样,均匀分配到三类扰动,LLM 自动生成扰动问题,最后由人工验证确保问题确实无法回答且语言质量合格。
4.2 数据集
表1:数据集统计
反事实样本约占各数据集总量的 10%,构成可回答不可回答混合基准。
4.3 实验设计
• 骨干模型:GPT-5 和 Qwen3-14B
• 基准方法(5个):PoT、标准RAG、LLM as Retrieval Judge、LLM-Instructed Retrieval、ReAct
• Embedding模型:英文数据集用 text-embedding-3-large,中文数据集(CFBenchmark)用 M3E-large
• 评估指标:
• Total Acc.:全集准确率(含可回答与不可回答样本)
• Abst. Acc.:弃答准确率(不可回答子集上正确触发弃答的召回率)
4.4 主要实验结果
表2:金融数值推理任务比较结果
GBFR 在所有数据集、两个骨干模型上均达到最优。
4.5 消融实验
在 FinQA 上移除各模块:
表3:消融实验结果
约束对弃答能力至关重要;图分解对总体准确率最为关键;程序执行对消除算术错误也很重要。三个模块缺一不可。
4.6 模型鲁棒性
在开源模型上的测试表现稳定,即便规模缩减 47 倍(从 DeepSeek-V3.2 671B 到 Qwen3-14B),性能保留率高达 97.7%(76.73% vs 78.53%),证明 FMKG 的符号约束能有效弥补小模型推理能力的不足。
表4:不同规模模型的性能对比
5. 总结
GBFR 是一个神经符号融合框架,其本质贡献在于将金融推理问题从语言生成重新定义为图约束的可验证计算。通过知识图谱的构建(FMKG)、推理计算的规划(四原子算子)和结果的验证(跨路径核查)三个环节,实现了正确的金融数值计算和安全拒答,并在多个维度上超越了现有方法。
指导老师:洪亮
编辑:付强 蒋翱远
推荐站内搜索:最好用的开发软件、免费开源系统、渗透测试工具云盘下载、最新渗透测试资料、最新黑客工具下载……




还没有评论,来说两句吧...