来自该信源的全部动态 · 共 981 条
论文面向多产品齐套配送下的柔性装配流水车间调度,提出滑动窗口强化学习框架SWRL,用于动态订单到达时的端到端在线排程。方法针对供给依赖变化与作业-机器可行分配集波动,服务混合制造系统的实时调度优化。
论文提出「具身算子」概念,将多模态观测、机器人状态、示教与任务上下文转化为结构化表示、决策、轨迹和控制引用的功能模块,作为可独立评测且可组合的具身智能流水线单元,并讨论面向可复用、可部署系统的基准化方法。
论文针对AI输出对齐验证问题,质疑「辩论」方法依赖两个能力相当模型的假设,提出基于双高效交互证明的可扩展安全验证框架,让弱验证者以较低成本检查强模型结论,为AI监督机制提供理论替代路径。
论文提出VERITAS,面向科学研究复现的通用工具,尝试用编码智能体自动化独立验证流程。其目标是突破现有复现基准只能在封闭流水线中运行的限制,降低人工复现实验的时间和成本,提升科研审查可扩展性。
论文提出对象中心环境建模OCM,将LLM智能体交互经验组织为可执行的对象中心环境,以替代难维护的自由文本记忆。方法面向长期经验积累、验证与复用,试图弥补现有符号技能或程序化世界模型偏局部、动态假设简化的问题。
论文讨论参与式设计和AI对齐中常用的局部成对比较方法,指出其默认个人偏好可由局部比较充分表达且回答总是明确。作者从「内部多元性」出发,分析这些假设在自动化决策规则学习中可能失效的条件。
论文针对用大语言模型模拟问卷受访者的「硅采样」评估问题,提出跨调查迁移框架:让模型基于某项调查中的个体回答预测其在另一项调查中的回答,以区分总体分布拟合与个体层面一致性。
论文提出一个面向大规模城市出行的端到端分析框架,利用移动应用产生的实时位置数据,支持旅游规划、停车管理、公交线路优化、资源分配等场景,并扩展到位置服务、市场份额分析和行为画像等商业决策。
论文比较两类基于LLM的编程学习导师:以苏格拉底式提问引导反思的SG,以及侧重改进提示词的PR,考察其对学生提示实践、学习效果和后续独立使用LLM方式的影响,关注教育场景中如何避免被动依赖模型。
论文提出MentalThink视觉符号推理范式,让多模态大模型在多轮推理中生成、渲染并解读SVG代码,作为中间视觉表征。模型可用结构化矢量草图外化空间假设,提升对几何、布局和视觉关系问题的可解释推理能力。
论文提出用Incognita评估社会分布式任务环境中的生成式智能体,关注其何时求知、何时行动,以及行动是否由已获信息支撑。该设置结合可执行动作、持久状态、可验证结果与多智能体社交互动,为更贴近真实协作场景的Agent评测提供框架。
论文研究部分可观测环境中强化学习智能体如何接入小语言模型推理先验。作者指出朴素不确定性门控在测试环境中几乎不触发覆盖,导致模型难以提供独立帮助,并围绕ASK机制改进辅助策略。
论文提出 MedCalc-Pro,面向真实临床中的复杂医学计算评测LLM智能体。相比只指定单一计算器的简化基准,它覆盖多计算器联合评估、嵌套量表计算和模糊查询,更贴近医疗工具调用场景。
论文提出Collaborative Routing Constructors(CoRC)框架,用于大规模容量约束车辆路径问题。其针对客户分区后独立求解可能导致需求未服务的问题,通过协同优化分区与路线构造,提高车队资源利用与解的可行性。
论文关注前沿语言模型后训练中由任务套件与部署环境分布偏移引发的泛化失败,主张在简化条件下构造干净可控的演示,并提出基于条件策略混合的灵活框架,用于分析和复现实例。
论文指出预测市场交易不只是给出校准概率,现有基准中概率预测与交易收益存在明显落差。作者提出 Raven-Agent,聚焦将模型信念转化为交易决策的自治交易智能体,用于更真实评估通用 AI 的事件预测与行动能力。
论文研究在缺少逐状态专家动作标签时,如何评估智能体对决策策略的编辑与修复。作者以酒店定价模拟器为例,仅向策略编辑器提供区域级诊断反馈,分析聚合分布对齐可能掩盖局部错误的问题。
论文提出开源框架REDI,面向领导级计算设施中的大规模科学数据,统一数据摄取、预处理、转换、结构化与就绪评估,并加入溯源跟踪和面向Agent的部署能力,旨在降低科研数据转为AI训练数据的工程门槛。
论文讨论现代AI在缺少成熟学科式概念与科学基础的情况下取得高能力,指出其发展更多依赖性能驱动迭代和「炼金术式」实验。作者尝试从严谨性视角系统审视AI研究范式及其张力。
论文提出面向LLM智能体业务流程执行的「组织记忆」思路,用于整合企业政策、流程模型、SOP等分散知识,弥补通用模型缺乏组织上下文的问题。该方向关注如何让智能体在复杂业务场景中更可靠地检索、遵循并执行企业特定规则。