来自该信源的全部动态 · 共 1160 条
论文提出 WebGrader,用自进化程序化评分器训练面向网页开发的 LLM,缓解强化学习中奖励设计瓶颈。相比人工浏览器脚本和 VLM/GUI 评测,方法强调可执行、可扩展并能观察关键页面状态,面向自然语言生成完整网站的功能提升。
arXiv论文提出ReASearch框架,探索由单一工具调用智能体统一完成提示词、程序和机器学习工作流优化。不同于依赖进化搜索、 bandit或文本梯度的外部控制器,该框架让智能体自主决定评估对象、诊断结果并调整搜索策略,展示推理驱动优化替代传统外循环方法的可能性。
论文提出C4,用于评估多模态大模型能否理解非显性的跨概念关系,即从图文等线索中还原创意表达的意图。该工作聚焦设计、传播、教育和人机协作中的接受式创造力,试图弥补现有准确率导向任务难以衡量创意理解的问题。
论文提出 KNOWPLAN,用知识驱动智能体从课程目录、院系页面、JSON接口和PDF等异构来源重建大学培养方案,再结合先修课逻辑与重叠要求,为学生优化个性化学位路径,面向教育规划中的数据抽取与约束推理问题。
论文提出EntropyMoE,用熵感知的稀疏专家路由改进字节级、无分词LLM。它针对动态字节patch语义和粒度差异分配不同专家计算,缓解现有架构对所有patch使用同一稠密前馈计算的问题,目标是在容量利用和建模效率上取得更好平衡。
论文关注稀疏混合专家奖励模型的可解释性问题。现有方法主要依据路由权重较高的提示词描述专家特征,但路由只能说明专家接收了什么,无法揭示其如何评价不同响应。作者提出贡献对比方法,从响应层面比较专家对候选答案的实际贡献,以获得更忠实的判断解释。
论文提出TaskSense,针对视觉控制世界模型过度重建全画面导致潜表示容量被背景和干扰物占用的问题,引导模型聚焦任务相关内容,缓解视觉重建目标与控制目标不一致带来的表示偏差。
论文研究自动化题目评估,尝试仅依据题目文本预测其在大规模标准化考试项目中的接受或淘汰结果。研究使用包含52,759道英语语言艺术和数学题目的历史拒题数据,并引入大模型生成的批评意见,旨在构建接近全面的题目质量评估模型,减少人工专家审核和实地测试需求。
论文指出文本生成视频模型让假新闻视频可从零合成,突破以既有素材拼接为主的低成本伪造形态,并造成检测器的模态对齐陷阱。作者强调现有数据集缺少纯合成假新闻视频,提出面向该新威胁的数据与检测问题设定。
论文提出 CGMas 多智能体框架,用于自动化聚合物粗粒化分子动力学建模,覆盖拓扑构建、平衡、映射与势函数推导,旨在降低底层粗粒化建模对人工经验和重复参数化的依赖。
WebRider指出,实时网页任务委托的核心不只是获得正确答案,还包括传递核验要求、不确定性处理方式、用户偏好及停止条件。论文通过完整的实时审计发现,现有网页智能体主要按最终答案评估,可能掩盖对委托策略的违反,并提出以角色和意图为条件的控制器评估框架。
论文评估六家开发者的六个前沿语言模型在显式引导压力下的行为可塑性,使用300组基础与引导样本,覆盖价值冲突、推理诱导和推理抑制等场景,比较不同训练数据、目标与安全流程带来的可测行为差异。
论文提出CellWorld空间转录组基础模型预训练方法,以潜在空间中的细胞表征预测替代基因身份或表达值重建,减少对测序平台和实验流程等技术变异的直接拟合。该路线有望提升模型的可扩展性与跨数据集迁移能力,为空间生物学表征学习提供新范式。
论文提出MolBioKG,面向生物医学知识图谱中的未注册分子冷启动问题,通过多分辨率结构锚定,将274万分子索引与生物医学证据连接,使图外分子可被纳入药物发现相关推理与检索流程。
论文提出bioMoR,将Mixture-of-Recursions引入基因级和通路级组学建模,通过生物学先验指导路由,让不同基因或通路按需分配计算深度,旨在提升高维组学Transformer的效率与有效性。
该论文提出Agentic MLLM合并问题,关注将面向不同工具和环境训练的智能多模态大模型整合为通用模型。作者指出,不同交互复杂度会导致能力保留不对称,并设计由粗到细的弱任务修复方法,以减少合并后的能力退化,提升模型在多工具、动态环境中的综合表现。
论文聚焦供应链运输中的车辆路径问题,探讨深度强化学习在工业卡车规划场景中的应用。研究以实际工业运输需求为案例,尝试利用智能算法优化车辆调度与路线决策,为复杂约束下的运输效率提升和物流自动化提供研究参考。
MemPrism提出任务条件化的关系记忆框架,将长期经验存储与决策时工作记忆分离,缓解固定表示导致的表示错配问题。其核心是按当前任务重组已有证据,为长程智能体提供更适配的记忆视图。
论文关注多模态大模型推理中的视觉Token成本问题,提出学习预测语言模型中层的文本到视觉注意力,用于估计视觉Token重要性并指导剪枝。目标是在减少视觉Token处理量的同时保持视觉语言任务性能,属于MLLM高效推理方向。
论文提出ADIAS,用于自动设计交互式智能体系统。其核心从候选智能体中心转向问题中心,显式记录跨轮修复进展,以提升修复目标定位、部分改进整合和无效干预过滤效率。