来自该信源的全部动态 · 共 981 条
论文提出将编码LLM用于软件行为推理的内部表征称为软件世界模型,并指出现有代码执行基准主要覆盖控制流。作者尝试从执行资源等可观测维度扩展评测,以更全面衡量模型对程序运行特性的理解。
论文提出 SidConArena,用于评估 LLM 智能体在开放式正和谈判中的表现。框架构建多人经济环境,考察协商、创造剩余、争夺稀缺资产以及延迟收益下的规划能力,弥补静态推理和零和博弈评测不足。
论文提出ODYSSEY范畴框架,将基础模型构建为多个foundry组件的组合,用层论组织局部知识、表示、限制映射、拼接规则与更新义务,目标是在局部上下文中保持真值并支持可验证的人机视图。
论文面向神经符号几何解题,指出现有方法在自动形式化与定理预测上存在瓶颈:翻译过程与求解器兼容性脱节,固定规则库易陷入推理停滞。作者提出求解器驱动的自动形式化与定理生成机制,以提升几何问题求解的可验证性和完备性。
论文研究人格提示如何影响多智能体LLM团队的沟通风格与客观任务表现,系统比较高低宜人性等人格组合在多个领域中的协作、对抗语言及任务结果,试图厘清行为变化是否真正转化为性能差异。
论文提出OverFlowLight实时交通信号控制框架,针对高峰期车辆排队超出路口容量导致的上游阻塞和级联拥堵,在优化通行效率之外加入溢出预防目标,用于城市交叉口信号配时与网格化拥堵缓解。
论文提出自动化设计范式AiD及计算设计综合框架CDS,利用深度学习与生成式AI应对高科技系统设计中的组合复杂性。作者通过电驱系统设计和空间尺寸规划两个案例验证方法,展示AI生成新系统方案的潜力。
论文提出DysLexLens,一个低资源LLM框架,用于从在线论坛中分析读写障碍学习者使用AI工具的真实体验。框架强调端到端处理与证据可追踪,面向阅读、写作、组织和学习支持场景,补足无障碍AI研究中的用户经验缺口。
论文研究图世界模型在长程规划中的滚动误差传播问题。作者关注由智能体、工具、技能、路线和依赖构成的图环境,分析局部预测误差何时保持局部、何时沿图扩散,以及边由模型预测时带来的新失效模式。
论文提出面向自主Agent的「原生免疫系统」框架,指出传统边界安全和训练期对齐难以防御运行时劫持,如记忆投毒、工具滥用和多智能体传播。文章梳理威胁分类、架构组件与工程实现方向。
论文提出 DataStates-LLM,用可组合状态提供器管理大规模 Transformer 训练中的分布式检查点。面向万亿参数模型和混合并行场景,改善容错、暂停恢复及异常训练轨迹分析等需求。
论文提出OPI,用本体引导多跳知识图谱问答中的证据路径推理。针对主题中心扩展带来的搜索空间膨胀、噪声混合路径及语义约束不匹配问题,方法利用本体信息约束路径检索与推理,以提升复杂问题的可解释性和答案准确性。
论文指出,LLM研究中「机器遗忘」概念被泛化使用,建议仅用于针对明确遗忘数据集、消除其训练影响的场景;版权、合规删除、安全策略等需求应与模型编辑、行为抑制等任务区分,以提升评估和监管讨论的准确性。
论文提出Agentic Publication Protocol,主张将科学成果从静态论文扩展为可由大模型智能体执行和复用的操作性知识,覆盖代码运行、图表复现、边界案例解释、后续研究方向与失败路径记录,以提升科研可复现性与知识传承。
该论文提出用卷积神经网络和残差网络处理MRI图像,实现脑肿瘤自动检测,并强调迁移学习在小规模医学影像数据中的作用。研究面向提高早期诊断效率、减少人工阅片依赖,但从摘要看方法较常规,创新性和临床验证信息有限。
论文提出ATOD,用于训练小型语言模型多轮自主智能体。方法将按轮次退火的在策略蒸馏与强化学习结合,前期利用教师密集指导快速模仿,后期转向奖励优化和探索,以缓解OPD性能饱和并提升长程交互任务表现。
该论文研究用可解释的集成机器学习模型识别丙型肝炎患者是否已发展为肝硬化,面向症状不明显、诊断延迟的临床场景。工作强调模型性能与可解释性结合,用于辅助早期筛查和风险评估。
论文提出面向自主AI系统的计算治理模型:不试图监控智能体推理过程,而是在临床处方、生产部署等关键行动点要求独立证明与可验证证据,借鉴人类制度治理强大自治主体的经验。
论文提出OpenFinGym,用于评估大语言模型量化金融智能体。其强调可验证、多任务和金融流程相关性,覆盖预测、策略构建、风险管理、交易等相互依赖环节,弥补现有单任务基准难以衡量真实量化工作流能力的问题。
论文以电动公交车队运营为场景,研究智能体系统在聚合商框架下如何协调电价、充电资源、荷电状态、线路能耗不确定性与V2G机会,并分析定价行为、运营权衡及政策影响,为交通能源协同调度提供仿真视角。