来自该信源的全部动态 · 共 981 条
论文研究LLM在语义等价改写下的回答稳定性,覆盖事实问答与数学推理任务。作者在4个基准、13个模型上发现,模型输出常受具体措辞影响,提示仅看准确率不足以衡量知识应用可靠性。
论文提出PhononBench-MP40,用于评估材料项目晶体在特定工作流下的声子稳定性。数据集源自47969个MP40任务,包含46899条完成记录,提供谱分辨信息和稳定性标签,面向计算材料筛选中虚声子模式导致的动态不稳定判定问题。
论文提出 QFoldAgent,用闭环多智能体结合 VQE 的量子经典流程,自动搜索 5 残基四面体晶格折叠中的惩罚权重,减少人工设参对蛋白结构预测结果的影响。
论文提出Schema-Aware Localisation,用于企业Oracle数据库的自然语言转SQL。方法通过实时模式接地,让模型查询实际表列信息,并验证生成SQL中的列名、别名幻觉,重点缓解ORA-00904等无效标识符执行错误。
论文关注编码智能体接入软件工程流水线后的系统级安全风险,指出其工具调用可能持久修改脚本、配置和环境,并在后续触发滥用权限。研究主张以真实执行结果为基础测试智能体行为,而非仅做静态提示或输出审查。
论文研究LLM在边缘和嵌入式设备上的部署约束,提出多目标结构化剪枝框架,同时优化推理时延、模型大小与资源占用,以在压缩率和可用性之间取得更稳妥权衡。
论文提出用多臂老虎机做CNN特征图结构化剪枝,将候选特征图视为臂,通过临时遮蔽并观察损失变化评估重要性,优先删除低影响通道及对应卷积核,以降低存储和推理成本。
论文提出MedLoCoMo医疗长上下文记忆基准,基于去标识化MIMIC-IV及病历笔记构建多次入院对话任务,评估大模型能否在纵向患者病史中连接证据、进行临床推理并在信息不足时拒答。
论文提出「参考特征图谱」:在参考模型组上一次性训练稀疏特征库,新模型仅需拟合线性解码器即可接入。该方法为跨模型内部特征提供稳定坐标系,减少重复解释成本,面向语言模型机制审计与可解释性分析。
论文针对工业智能体评测场景依赖人工编写、资产类别有限的问题,扩展AssetOpsBench,加入智能电网变压器资产类和基于IEC标准的诊断工具,用于生成更贴近遥测、故障、维护记录的合成评估场景。
研究比较LoRA与全量微调在程序性知识上的表现,发现当任务涉及条件分支与终点状态时,LoRA在保持效率优势的秩位下明显不及全量微调,说明这类能力未必能被低秩更新充分内化。
论文提出SCOPE基准与SCION参考流水线,面向从原始文本自动归纳模式图及可选模式融合的评测任务。数据来自24个公开视频信息抽取来源,覆盖关系抽取与事件抽取,旨在缓解知识图谱构建中预设模式依赖的问题,并提供可审计流程。
论文提出谱流证书,用于在训练前低成本评估图结构是否支持GNN在指定深度内完成远距离信息传播。方法面向长程依赖任务的可行性诊断,帮助判断拓扑瓶颈,减少在不适配图上的无效训练。
论文指出,生成式世界模型在规划中需分叉状态、回滚并重返视角,现有基准常把失败归因于模型架构。作者认为对部分模型而言问题在运行时,提出保存持久计算状态的会话中心运行时,以支持更可靠的模拟式使用。
该论文提出面向部署的LLM延迟预测框架,用于在异构边缘设备上快速筛选模型。方法将推理请求建模为运行时感知表征,考虑模型结构、提示行为、后端、硬件利用率、DVFS与热变化等因素,以提升跨设备延迟预测的可迁移性。
论文提出 QLPO,通过四象限加权采样在强化学习中控制长思维链长度,减少推理模型输出过长带来的延迟和部署成本,同时尽量保持推理质量,避免依赖额外控制模块或复杂长度惩罚调参。
论文提出AgentKVShift,针对记忆增强型LLM智能体在多轮交互中反复重编码结构化记忆导致的prefill延迟问题,探索训练免费KV缓存复用。方法面向带摘要、关键词、标签等元数据的智能体记忆单元,旨在降低检索触发的推理成本。
论文提出「适配器必要性审计」,用于判断在冻结的命令条件运动策略上加入学习型适配器是否真正有价值。方法区分全局操作点增益、同状态反事实提升空间、部署期相对固定动作增益,以及相对随机策略的状态分配增益,面向机器人闭环部署评估。
论文提出GLASS,一种无需训练的个性化文本生成框架,通过全局稀疏先验与局部语义校准进行激活引导,从历史文本中提取用户写作风格,同时降低检索、微调或存储带来的推理开销,并尝试分离风格信号与语义内容。
论文提出面向玻利维亚路障事件的混合概率预测系统,将Prophet时间序列分解与自然语言处理结合,用于提前预警社会冲突导致的物流中断。研究聚焦本地化预测缺口,评估从季节性到语义信息的融合效果。