来自该信源的全部动态 · 共 1160 条
论文提出MolBioKG,面向生物医学知识图谱中的未注册分子冷启动问题,通过多分辨率结构锚定,将274万分子索引与生物医学证据连接,使图外分子可被纳入药物发现相关推理与检索流程。
论文评估六家开发者的六个前沿语言模型在显式引导压力下的行为可塑性,使用300组基础与引导样本,覆盖价值冲突、推理诱导和推理抑制等场景,比较不同训练数据、目标与安全流程带来的可测行为差异。
论文提出 CGMas 多智能体框架,用于自动化聚合物粗粒化分子动力学建模,覆盖拓扑构建、平衡、映射与势函数推导,旨在降低底层粗粒化建模对人工经验和重复参数化的依赖。
论文提出TaskSense,针对视觉控制世界模型过度重建全画面导致潜表示容量被背景和干扰物占用的问题,引导模型聚焦任务相关内容,缓解视觉重建目标与控制目标不一致带来的表示偏差。
论文提出IB-RL,用于训练战略对话场景中的语言模型智能体。相较数学、代码等固定奖励任务,战略对话的环境由会适应策略的另一智能体构成,训练目标需考虑双方互动与非平稳性。该工作聚焦更贴近谈判、博弈和多智能体协作的RL范式。
论文提出DKG-MTI,用于从在线旅游评论中统一完成多任务用户意图推断。方法通过推理时知识增强,动态构建用户特定意图知识图谱,并结合领域结构关系,缓解传统层级流水线误差传播和检索方法忽略知识结构的问题。
论文提出 LiFTER,将连续时间动态图链路预测与可解释的时序规则归纳结合,在预测架构内显式揭示事件间共享实体和时间模式,试图提升动态图模型的可解释性与可追踪性。
论文聚焦多标签节点分类的跨域泛化问题,指出现有方法多局限于同一图域训练和测试。作者提出面向多标签图基础模型的思路,从单向量节点表示转向多语义基学习,以更好刻画节点同时具备的多重语义。
MemPrism提出任务条件化的关系记忆框架,将长期经验存储与决策时工作记忆分离,缓解固定表示导致的表示错配问题。其核心是按当前任务重组已有证据,为长程智能体提供更适配的记忆视图。
论文关注多模态大模型推理中的视觉Token成本问题,提出学习预测语言模型中层的文本到视觉注意力,用于估计视觉Token重要性并指导剪枝。目标是在减少视觉Token处理量的同时保持视觉语言任务性能,属于MLLM高效推理方向。
论文提出 Ignition Index,以四参数 sigmoid 拟合各层线性探针准确率随输入信号强度的变化,用斜率参数量化 Transformer 语言模型中类似全局工作空间理论的「点火」式跃迁。研究在多款模型上验证该标量指标,可区分突变式与渐进式表征形成。
论文提出 Recursive Synthetic Terminal Tasks(RST),用递归验证方式生成终端智能体长程训练任务,解决人工编写成本高、LLM直接生成易破坏指令、环境、参考解和验证器一致性的问题,面向可扩展的高质量Agent数据构建。
论文研究将135M至14B参数、四类架构的14个模型在Psych-101数据集上训练,该数据集含160项实验、1070万次试级选择。结果显示分布内任务中模型规模影响很小,聚焦认知代理是否真正学习任务结构而非统计捷径。
论文提出SearchAuditBench与SearchAuditor,用于评估和定位长程网页搜索智能体的失败原因。研究关注小推理错误在长轨迹中累积并导致错误答案的问题,试图减少人工检查超长执行轨迹的成本。
论文提出 SkillTrace,用于审计 LLM Agent 生态中可复用「技能」的来源与复用关系。作者指出技能包包含元数据、自然语言指令、代码、工具、引用和工作流,证据分散在多模态内容中,传统代码克隆或整包相似度检测难以覆盖,因此需要多轨迹溯源审计方法。
论文提出SCP-NL2TL,将选择性保形预测与语义验证结合,用于把自然语言指令转换为时序逻辑规范。方法在低置信或语义不匹配时拒绝输出,降低机器人和自治系统在安全关键场景中采用错误规格的风险。
论文研究大模型智能体控制显微镜等科研仪器时的基准有效性,比较模型选择、单/多智能体架构等设计因素。结果显示,现有自驱显微镜基准可用于系统资格评估,但对未见任务的泛化预测有限,提示科学仪器智能体需更谨慎验证。
论文提出PD-GS,用音素信息驱动3D Gaussian Splatting说话人头生成,针对连续声学嵌入回归导致的口型过平滑和「漏嘴」问题,强化双唇闭合等短暂离散发音约束,提升音频驱动头像的唇形准确性与写实渲染稳定性。
论文指出,多轮智能体的特权在策略蒸馏会因学生动作改变环境状态而出现教师指导错配。作者提出状态匹配路由与上下文化自蒸馏,让教师监督对齐学生当前轨迹与子目标顺序,提升交互任务中的训练稳定性与效果。
论文提出Project2Task,将开放式科研项目拆解为多个有边界、目标相关且具依赖关系的任务,并用图结构指导长期规划、并行路径与执行顺序,针对单任务科研智能体难以管理项目级议程的问题。