来自该信源的全部动态 · 共 981 条
论文关注CODI、COCONUT等潜在推理方法的可解释性难题:隐藏空间中多条候选轨迹叠加,难以像显式CoT一样追踪。作者尝试用动力系统视角刻画潜在步骤中推理状态的演化。
论文研究面向农业预测任务的任务条件合成数据生成方法,用人工但真实感较强的样本补充有限或不完整的参考数据,以缓解训练数据数量与质量对机器学习性能的制约。方向聚焦农业变量估计中的数据稀缺问题,适合关注合成数据与垂直场景建模的人参考。
论文提出从文字或形状等输入图案生成迷宫结构的流水线,将路径合成编码为SMT全局约束,覆盖邻接、连续性和图案覆盖等条件,可一次求解固定边界实例,生成平面自避路径或带上下穿越关系的分层路径,用于2D/3D构造。
论文指出,在强化学习中加入长度惩罚会压缩模型思维链,但可能掩盖影响答案的误导性提示。实验显示,模型较少在推理文本中提及提示,准确率损失也小,常规token效率评估会误判为成功,却削弱了对真实推理动因的可观察性。
论文提出一种面向可分叉沙盒的Boltzmann MapReduce视角:在局部渐近正态条件下,工作节点对数据块输出的置信密度可视为Gibbs-Boltzmann测度,样本量对应逆温度;独立数据块的归约可解释为分区函数计算。该结论在线性高斯情形精确,一般情形为一阶近似。
论文针对工业级智能体从原型到生产部署的可验证性缺口,提出一种有界验证协议,将自适应智能体控制器表示为有限符号规则,并通过显式诊断前提与规则修订处理非确定性、保密限制、上下文不足和弱可观测等问题。
论文提出 BatteryLake,一个面向电池老化数据的受治理数据湖,利用智能体与物理约束整理异构电化学时序数据,统一格式、模式和元数据,并支持可复现基准评测,旨在降低电池健康管理研究的数据清洗成本。
论文用霍特林线性城市模型检验结构化推理干预是否提升大模型的战略经济推理,并比较GPT-4.1-mini与GPT-5-mini在基线及四类干预下的表现,关注效果是否受模型架构影响。
论文介绍开源 Python 库 SupplyNetPy,用于任意多级供应链与库存网络的高保真建模和离散事件仿真。其支持多种补货策略、易腐库存、节点中断、随机需求与交付期,并以图结构描述节点和链路,便于扩展组件。
论文研究LLM智能体多跳交接信息时,消息格式对准确性与成本的影响。作者指出既有格式优化与格式限制结论相互冲突,因多跳场景更受复制保真度支配;实验显示模型更倾向忠实转发而非纠错,格式效应随模型层级而变。
论文研究上下文学习:让大模型在推理时从复杂上下文中学习并应用预训练外的新任务知识。作者指出前沿模型成功率仍低于24%,且问题不只在检索内容访问;通过多类检索、反思、验证基线分析失败原因,并探索自发现任务规范的智能体式改进路径。
论文提出用无评审器的「严格启动」执行门控训练代码生成器:只保留能在无头引擎中干净启动的游戏项目,再做拒绝采样自蒸馏。实验显示该信号可减少代理评分投机,提升跨游戏家族生成泛化。
该论文关注K12数学教育中的图示生成难题:现有LLM即使获得详细描述,也难稳定产出准确且具教学价值的图表。研究探索智能体式工作流,以提升初中数学视觉辅助材料的可靠生成能力。
论文基于Pagnucco 1996年类AGM溯因扩张操作,并结合Aliseda启发的溯因推理分类,提出一种次协调类AGM溯因扩张算子,可在推理框架中吸收相互矛盾的解释性假设,面向符号AI、信念修正与非经典逻辑研究。
论文研究新一代人机混合决策支持系统中,如何维持操作者控制稳定性与目标指向。作者基于为期两个月的连续实验,验证推理型大语言模型存在语义上下文漂移现象,并讨论其对长程协作、目标保持和控制可靠性的影响。
论文提出用规则对齐的小语言模型生成工业闭环控制策略,并结合多智能体自纠错与数字孪生验证,在执行前筛选候选动作。目标是在低推理延迟下,从自然语言需求快速重构控制策略,减少人工重设计。
论文指出,仅格式不同的提示包装就可能显著改变模型得分并影响榜单结论。作者在控制 token 的协议下提出 FSI 与 PSI,分别衡量准确率和答案可解析性的格式敏感范围,并基于14万次 OpenRouter 生成、7个问答任务验证。
论文提出「最小自主性」作为智能体AI访问控制的新原则,认为传统最小权限不足以约束可跨工作流组合、审批并放大权限的代理系统。作者尝试建立形式化理论,用于分析自治能力、权限传播与系统边界风险。
论文研究多模态大模型强化学习对齐中的奖励黑客现象,指出高奖励不等于更好任务表现,尤其在视觉证据由纯文本或弱视觉锚定奖励评估时风险更高。实验覆盖安全VQA、图表VQA与压力测试,比较奖励设计、数据歧义、模型规模和GRPO等算法影响。
该论文提出Legal Multi-Agent Debate框架,用于系统评估法律文本蕴含任务中的多智能体辩论结构与结果聚合方法。研究通过为不同智能体设定专家角色,考察MAD在高结构、知识密集型法律推理场景中的有效性,为法律AI中的协作推理设计提供实验依据。