来自该信源的全部动态 · 共 981 条
论文提出 PedNStream,一个开源、Python 原生的宏观行人网络加载仿真器,基于链路传输模型,面向大规模人群管理与闭环控制评估,弥补现有开源工具偏微观或难支持网络级反馈控制的不足。
论文研究对齐大模型在残差流中对「有害性」与「拒答」方向的表示,指出越狱会在提示编码阶段压制其中之一,并提出HARC将两类方向耦合,以提升安全对齐对越狱的鲁棒性。
论文提出Agentic Transaction Processing事务模型,将LLM、求解器或多智能体生成的工作流动作视为不可信提案,需在可执行约束集下通过确定性准入后执行,以避免过期、冲突、不可行或破坏证据的修复操作。
论文介绍Seed2.0模型系列,面向复杂真实任务构建基于用户需求的评测体系,并据此优化长尾知识与复杂指令遵循等难题,强调以场景化基准牵引模型能力迭代,可为模型评测和对齐训练提供参考。
论文提出面向Agentic RAG的可信度估计框架,让规划、评估、生成阶段基于语义分歧和自评产生不确定性信号,并通过贝叶斯网络传播,用于预测多跳问答流水线何时可能失败。
论文提出 AGI Maze 基准,用部分可观测、具状态变化的迷宫环境评估智能体世界建模能力,强调记忆、隐藏状态假设与可操作外部表征,区别于仅依赖静态上下文的文本推理测试。
论文提出AgRefactor,用自进化智能体工作流将真实软件重构为更兼容高层次综合的代码,并兼顾性能优化。作者针对传统自动化与LLM重构在可扩展性、灵活性和计算成本上的不足,探索面向硬件生成场景的智能体式代码改写方法。
论文提出开放世界人工生命范式,认为具备长期记忆、工具使用、网络访问和支付能力的LLM智能体,可从封闭实验环境进入真实社会、技术与经济系统。OpenLife作为概念验证,探索自治代理在开放环境中的持续行为与演化。
论文将自动研究范式用于非凸问题下界证明,让编码智能体提出可验证的凸松弛收紧,配合对偶检查生成证书,探索LLM智能体在数学优化与不等式证明中的辅助发现能力。
论文提出 AgentBound,面向代表人类执行金融交易、外部通信和企业流程的自主智能体,补足现有身份联合与委托授权只能管访问、难以判断行为是否合规的问题,关注在具体上下文中对授权动作进行可验证的行为治理。
论文质疑当前智能体默认用户已具备清晰偏好的假设,指出在领域知识不足时,单纯追问澄清问题难以获得有效需求。作者主张智能体应通过教学、解释选项与权衡,帮助用户逐步形成偏好,为人机协作、Agent 交互设计和偏好学习提出新框架。
论文关注LLM数学推理中难以察觉的细微错误,提出面向研究数学的智能体式自动形式化框架,将自然语言数学转译为Lean 4等可验证代码,以机械证明检查提升可靠性,适用于定理与证明草稿的形式化探索。
论文研究由多个大模型评估器组成的LLM评审团机制,指出传统PoLL在Huber污染模型下,只要存在一个带偏失效评委,就可能产生无界偏差,评委数量增加也无法消除。作者提出RoPoLL以提升共识评分的稳健性,为LLM评测可靠性提供统计分析框架。
论文提出MultiUAV-Plat,面向大语言模型驱动的多无人机协作任务规划,提供平台、基准与框架,用于评估部分可观测、空间覆盖、无人机分配和多机协调等空中机器人约束下的LLM智能体能力。
论文提出BayesBench,用于评估大语言模型在多轮对话中随证据累积而更新信念的能力。研究关注模型是否能推断未观测变量、降低认知不确定性,而非只看最终答案,补足现有单轮评测对推理轨迹的缺口。
论文提出用于个性化投资组合管理的三阶段深度强化学习系统,针对既有金融RL中的股票代码锁定、单一目标和静态用户模型问题。其先以自监督方式训练跨资产编码器,并结合基于T5的Chronos时序基础模型分支。
论文基于2016至2020年泽西城Citi Bike数据,量化分析老年群体在公共出行数据中的稀疏代表性及其对轨迹建模、城市规划的系统性偏差影响,强调智慧城市移动性模型需纳入人口公平性评估。
论文提出Agentic RAG-VLM,用于杂乱环境中的通用机器人抓取。方法在检索增强生成中引入可供性意识,关注把手可抓取性、材料易碎性等物理属性,并结合自反思规划、空间推理与失败恢复,改进仅靠视觉相似匹配的开环VLM抓取方案。
论文提出 HASTE 分层多智能体系统,将跨机器学习竞赛经验按全局、领域、竞赛三层组织,并由编排器协调领域专家,通过大模型抽象推动知识上移与复用,减少智能体在新任务中重复探索已知技巧的计算浪费。
论文面向建模与仿真领域的模型复用难题,实验评估不同数据格式、嵌入方法与检索策略对模型发现效果的影响,探索用检索式AI在语义层匹配建模意图与已有仿真模型,为模型库搜索和资产复用提供方法参考。