来自该信源的全部动态 · 共 981 条
论文提出面向智能温室强化学习控制的校准优先奖励审计框架,不只看单一模拟器回报,而是按加热、二氧化碳、通风、湿度、遮阳和补光等具名组件解释策略行为,帮助种植者与控制工程师复现实验并诊断控制决策。
论文在24GB笔记本上固定一个4B生成模型,评估端侧研究智能体从检索、阅读到生成带引用简报的表现。作者区分「被引声明忠实度」与「可信覆盖率」,分析上下文曝光和检索质量如何分别限制引用可靠性与覆盖范围。
论文提出NameRank,用0到1分数衡量前沿大模型在无检索条件下对人物或工具的参数化识别程度。研究覆盖54个群组、4685个实体和36个模型,分析引用之外的识别残差,有助于理解模型记忆、知名度偏差与首轮回答影响。
论文提出EVOQUANT,用自进化与验证器引导机制优化量化交易策略,目标是减少LLM直接改写策略时的幻觉、策略漂移和回测过拟合。框架面向弱信号识别、风控规则调优与迭代验证等人工瓶颈,探索LLM在量化研究流程中的可控应用。
论文关注肌肉骨骼疾病的长期康复管理,指出临床证据分散、病程跨月年至数年,AI需持续整合患者动态数据、外部医学知识与阶段性功能目标,以支持更可靠的纵向护理决策。
论文提出一种阈值超越框架,用于评估前沿语言模型是否相较公开工具显著提升非专家实施化学、生物、放射性或核滥用规划能力。框架试图统一威胁范围、基线、评分与决策规则,提升CBRN安全评测的可比性。
论文研究同骨干推测解码方案PEFT-BD:用类似LoRA的块扩散适配器生成草稿,再由目标模型验证。结果显示,仅提升已接受前缀并不足以带来有效加速,提示低参数草稿器设计存在质量与系统开销的权衡。
论文提出将函数感知的填中间训练用于编码智能体基础模型,把工具调用返回与后续推理的关系类比为函数调用点中的参数绑定、返回值和消费逻辑,以弥补传统从左到右代码预训练对外部工具反馈建模不足的问题。
论文提出动态场景交互推理框架,用于多车交互场景下的车道级换道意图与轨迹预测。其目标是突破单目标车辆预测的局限,同时显式刻画机动意图和场景演化,为ADAS和自动驾驶运动规划提供更可靠输入。
论文提出LegalFarePlan,用标签设定方法处理城市轨道非加性票价规则,将合法出站再进站操作建模为可审计约束,综合换乘规则、站点成本和额外时间等因素,生成费用透明的路线方案,面向公共交通路径规划与票价优化研究。
论文提出将图像诊断结果按图尔敏论证模型拆解为主张、依据、保证、限定、反驳和支撑等要素,用于视网膜诊断等场景。相比直接采纳模型预测或仅用XAI解释,该方法强调结构化、可审查的诊断论证。
论文提出PHITSBench,用于评估AI基于自然语言生成PHITS蒙特卡罗辐射输运输入的能力。基准含282个可执行评分任务,覆盖参数编辑、语法修复和完整仿真复现,并以综合指标结合运行成功率等结果。
论文提出 YUKTI,将自然语言情境转为带不确定性类型的命题中间表示,不再依赖单一目标和点估计参数。框架通过假设稳健的帕累托前沿与后悔证书,帮助检验预算、临床等高风险决策方案在参数偏差下的脆弱性。
论文提出面向智能体分布式系统的「认知状态复制」框架,认为传统状态机复制追求比特级一致,难以适配由生成式模型驱动、具备随机性和自主性的智能体。该方法关注副本间信念、目标和决策依据的一致性,为智能体编排基础设施的可靠性提供新抽象。
论文将反馈耦合记忆系统扩展到连续时间框架,试图形式化闭环协调中的记忆、智能体与环境更新。其重点是为原框架中未定义的更新算子补充机制化解释,包括基于去中心化价格机制的局部智能体更新。
论文研究在由低成本、不可靠智能体组成的图共识网络中,如何以有限预算放置少量强纠错器,引导群体趋向正确结论。作者将纠错强度与成本耦合,分析一致性质量指标的次模性,并讨论近似优化策略。
论文提出GES,一种面向欧氏旅行商问题的学习式图边稀疏化方法,用实例结构信息替代固定启发式,筛除低价值边、保留潜在最优边,以降低大规模TSP精确求解的计算成本并提升求解效率。
论文研究LLM基准测试的核心集选择:在不使用模型评测结果的前提下,从多个基准中筛选少量提示,使其诱导的模型分数与排名尽量逼近完整测试套件。方法强调跨基准、细粒度提示级选择,可用于降低评测成本并提升基准维护效率。
论文提出 EvoCUA-1.5,将自进化电脑使用智能体从离线经验扩展到在线强化学习,针对多轮、长程、部分可观测的多模态桌面任务,通过真实交互学习屏幕状态变化、后续动作空间与错误恢复策略,弥补静态轨迹覆盖不足。
论文研究多智能体竞争环境中的规范执行问题,针对个体追求奖励可能损害集体利益的行为,提出稳健塑造智能体行为的机制框架,用于约束误导性营销等不良策略,关注AI智能体治理、安全与协作秩序。