来自该信源的全部动态 · 共 981 条
论文提出 BatchDAG,让 LLM 先生成带类型的有向无环图,把 SQL、语义检索、内存变换和并行分发组合起来,以支持企业级跨实体分析,缓解上下文溢出、归因丢失和串行调用带来的高延迟。
论文研究大模型推理期的 steering vector 控制,指出传统正负二元评测易导致表示不一致、可解释性和细粒度控制不足。作者提出概率化概念感知框架,用概念分布建模和校准干预强度,目标是提升可信推理与可控生成。
论文提出语义协作博弈框架,用博弈论方法为基于LLM的多智能体工作流分配贡献度,避免依赖反事实删除带来的重复推理、高方差和高成本,适合用于复杂协作链路的归因评估与分析。
研究表明,基于GSM8K构造的2.1万条结构化合成推理数据,可用GPT-5-mini生成自然语言解题链、苏格拉底式提示和结构变体,在消费级硬件约束下提升小语言模型的多步算术能力。
研究者提出 FindStatBench,用于评估大模型在组合代码合成上的执行能力。基准源自 FindStat,包含 2329 个任务、24 个集合和 552 万个隐藏实例,覆盖统计合成与映射合成两类问题,模型需根据数学描述和少量示例生成可运行的 Python 解答。
这篇论文提出 Fence,用专用小语言模型为闭源 LLM 应用提供更细粒度的安全护栏,覆盖幻觉、话题漂移和行为偏离等场景。作者指出通用内容过滤难以适配具体业务,且标注稀缺成本高,因此需要可按用例定制的防护方案。
Phionyx提出一种确定性AI运行时架构,将LLM输出视为噪声观测而非直接决策,通过结构化状态向量和确定性状态演化方程管理系统状态,并在响应前加入治理层,目标是提升可控性、可验证性与工程稳定性。
论文研究双智能体 LLM 接力中的状态压缩问题,在封闭世界旅行规划任务中发现,交接前压缩若遗漏审计、排除项或数值计算,容易破坏严格的类别与数值约束,说明长链代理的中间状态压缩需要更高保真机制。
研究用闭环方法自动设计MILP求解器逻辑:从求解器反馈中学习显式规则和控制策略,替代外部黑盒预测器,提升可解释性、可适配性与部署便利,并验证自动化设计的可行性。
论文研究LLM作为工具型自主Agent规划器时的多轮可靠性风险,指出单轮安全机制难覆盖长程交互。作者在多种前沿模型上实证刻画「安全漂移」与「操作幻觉」两类失效,揭示初始对齐会随执行过程退化。
论文指出现有LLM查询路由通常只优化效果与成本,忽视模型实例上的生成延迟;而传统负载均衡又不考虑准确率与费用。作者针对动态工作负载重新审视路由问题,为延迟感知的联合决策提供分析框架。
论文研究通过积分算子形式的分布式反馈控制实现无人机姿态角稳定,讨论算子可带无界记忆的情形,并从积分-微分方程角度分析控制设计思路,为基于历史状态的控制器构建提供理论框架。
论文指出,现有智能体风险方法要么只描述失效机制、无法迁移估计,要么只给出风险分数却忽略内部路径。作者提出 CPSAINT,用七层完整性分解把失效路径与残余风险连接起来,提升可解释与可量化性。
论文提出TRA方法,用严重度锚定的知识图谱与检索增强生成,将电子病历、外部医学知识和非结构化临床笔记结合,用于建模疾病严重程度、治疗反应与病程轨迹,从而提升患者临床风险预测能力。
论文研究15个大语言模型在254个二元预测市场问题上的概率估计,检验类似人类「群体智慧」的集成效果,并关注训练数据污染对结论的影响。结果有助于理解多模型投票、预测聚合与评测可信度的边界。
论文提出Evidence Chain Evaluation框架,用于选择性事实核查:当证据链稀疏、薄弱或自相矛盾时,模型可输出不确定而非强制二分类,并通过校准机制提升事实判断的可靠性与可解释性。
论文研究MLIR在代码模型预训练中样本稀少、且方言可扩展导致难以逐一微调的问题,提出基于各方言操作定义规格自动派生的推理约束,并构建相关基准评测其跨方言泛化能力,验证无需重训也能提升生成有效性。
这项研究提出一个与领域无关的框架,用大语言模型为时间序列预测生成有依据的自然语言解释,面向高风险决策场景。方法重点缓解LLM在时序数据上的幻觉问题,提升解释与预测结果的一致性和可用性。
论文提出一种神经符号元策略,在部分可观测强化学习中决定何时保留、检索或遗忘记忆,但执行仍保持符号化。方法面向 RoomKG 的时序知识图谱记忆,使用 RDF 图表示隐藏状态与观测,并结合可切换的符号记忆启发式。
论文提出ProbSPARQL,面向循环工厂等场景中由传感器产生或推导的多维、不确定数值数据,扩展知识图谱查询能力。其目标是支持分拣、验证、可靠性建模和再装配规划等下游模块,对不确定测量值进行更结构化的表达与查询。