深度搜索代理真实用户信息需求基准测试大语言模型规划符号反馈迭代自精炼框架大语言模型强化学习熵调度自适应推理塑造通过多阶段强化学习通过跨位置知识蒸馏缓解位置偏差神经符号规划知识反馈闭环架构大语言模型推理迭代DPO持续预训练学习动态通过更多上下文示例暴露能否减轻大语言模型的不确定性逻辑推理符号孵化器基于识别的反馈训练规划者大语言模型事实回忆行为知识神经元磐石·科学基础大模型,“人工智能+科学”的操作系统视觉语言智能体天体候选体光谱检查晶体结构生成的预测校正流匹配Multi-agent system for material discovery过程奖励模型用于反思性数学推理大语言模型推理策略优化数学推理人工智能社会舆论演化大语言模型智能体人格特质嵌入舆论动力学离线强化学习策略提取离线元强化学习加权策略约束近端上下文收集博弈决策规划对手行为追逃博弈三维空间离线学习在零和博弈中的利用层增强