When Do Symbolic Solvers Enhance Reasoning in Large Language Models?
文章主要内容与创新点总结一、主要内容本文聚焦大型语言模型(LLMs)推理能力的优化问题,核心探讨符号求解器集成方法在何种场景下能超越传统的思维链(CoT)提示策略,提升模型推理性能。研究背景:LLMs通过CoT提示能生成逐步推理过程,但存在“过度思考”导致的token开销大、准确率下降等问题,尤其在复杂多步推理任务中受限于Transformer的模式匹配机制;而现有符号求解器集成方法多针对简单合成数据,在最新LLM(如GPT-4o)性能提升后,其适用场景尚不明确。研究设计:数据集:涵盖三类推理任务(算术推理:GSM8K、GSM-Reversed、GSM-Hard;约束满足问题:ZebraLogic;逻辑蕴含推理:EntailmentBank),共5个数据集。方法:采用Prolog(结合clpr库)和Python(结合Constraint、SymPy库)作为形式化语言,设计声明式示例提示,将自然语言问题逐句转化为声明式代码,再通过符号求解器执行。对比实验:比较CoT提示与符号求解器集成方法(零样本、单样本声明式提示)在不同模型(GPT-4o、Claude 3.5 Sonnet、Llama-3.1-405B、CodeLlama-13B)上的表现。核心发现:CoT提示在浅层演绎推理、需挖掘隐含语义规则的任务(如GSM8K、EntailmentBank)中更

相关新闻

最新新闻

日新闻

周新闻

月新闻