来自该信源的全部动态 · 共 321 条
该综述系统梳理了智能体技能库的评估与演化研究现状。随着技能库规模持续增长,领域正从孤立的技能创建转向自动化、评估驱动的技能演化范式。论文全面考察了现有评估框架与基准,关注技能的实用性、质量与安全性,为构建可扩展的智能体系统提供研究地图。
研究分析全双工语音语言模型(FD-SLM)隐藏表示中的预测行为,发现其具有流特定预测模式:听时优先预测用户输入流,说时优先预测自身输出流。论文揭示了模型在听说状态切换时存在「状态惯性」现象,并提出通过激活引导(Activation Steering)方法干预隐层表示来克服该惯性,改善轮次切换的灵活性。
针对去中心化LLM推理网络中轻量级、无参考答案的质量验证需求,提出PoQ-Judge框架。该框架训练专用评判模型对查询-输出对进行评分,研究了TextCNN、MiniLM交叉编码器和DeBERTa三种架构在质量与成本间的权衡,采用UltraFeedback加GPT标注域内数据的两阶段训练策略。
NightFeats是一个结构化多智能体RAG系统,参加NeurIPS 2025 MMU-RAGent竞赛文本到文本赛道并获最佳动态评估奖。该系统不以刷榜为目标,而是提出原则性流水线,将知识合成分解为检索、筛选、组合三个协调阶段,各阶段由显式中间表示治理,强调上下文优化与可解释性。
该研究针对工业安全数据表(SDS)的结构化信息提取任务,对 Gemini 1.5 Pro、GPT-4o、Claude 3.7 Sonnet 等主流大模型进行系统基准评测,比较纯文本与多模态处理管线的效果。SDS 格式异构、传统规则方法局限明显,论文为自动化提取提供了可参考的模型选型依据。
该论文提出Text to Multimodal Model(T2MM)架构,旨在解决LLM在教育场景中缺乏视觉交互能力的问题。T2MM利用大语言模型的多模态能力,为科学学习中的模型构建提供动态可视化与交互支持,将文本输入转化为可操作的多模态模型,辅助学生进行探究式学习。
标准线性探针在预训练早期即达到准确率饱和,无法反映后续训练过程中的表征变化。本文提出「脆弱性」指标,定义为使探针准确率崩溃所需的激活噪声水平,作为逐层互补度量。该指标在探针准确率饱和后仍能持续捕捉预训练中表征质量的演化,为理解LLM训练动态提供了更细粒度的分析工具。
该研究提出一种语义-时间尺度分析流水线,将带时间戳的词级转录转化为语义时间序列,用可解释的时序特征刻画通用与具体内容在时间维度上的分布差异,从而量化比较人类口语与大语言模型生成语音在语义波动模式上的区别。方法简洁且具通用性,为评估AI语言自然度提供新视角。
该论文提出 BioDivergence 基准,专门针对生物医学文献中因队列、地域、实验方案、疾病亚型等上下文差异导致的「表面矛盾但局部有效」的声明对。现有 NLI 和科学声明验证基准仅做蕴含/矛盾/中立三分类,无法捕捉分歧背后的上下文结构,该框架填补了这一空白。
该论文针对LLM安全评估数据集高度集中于英语和中文的现状,构建了面向保加利亚语和德语的安全评估基准。研究关注共享社会文化、法律背景下的多语言安全风险,旨在揭示非主流语言环境中模型生成有害内容的盲区,为多语言LLM安全对齐提供评估工具。
论文提出「向量搜索稀释」概念:当RAG系统扩展到大规模异构文档集时,密集相似度的区分力下降,top-k检索返回语义相似但上下文错误的片段。作者在怀俄明州交通部实际部署语料上验证了该问题,提出领域分区、模型无关的检索策略,在混合dense+sparse检索基础上进一步提升准确率。
标准RAG流水线对所有查询无条件执行检索与生成,造成冗余计算并将低质量上下文传递给生成器。EverydayGPT提出置信度门控路由(CGR)机制,将路由决策建模为检索距离与抽取充分性的联合策略,仅在必要时触发检索,从而降低计算开销并减少噪声上下文对生成质量的干扰。
研究提出 LifeSentence 模型,将纵向面板数据中的人类生命历程转化为序列,利用 Transformer 架构进行生命结局预测。该方法弥补了传统统计模型忽略生命事件时序结构的缺陷,同时解决了纵向研究数据量不足以训练大模型的难题,为健康、寿命等人生结局预测提供了新范式。
针对多模态大模型在视觉问答中依赖稀疏结果奖励、无法区分推理链中错误位置的问题,提出 ProcessThinker 方法。该方法结合 rollout 机制为推理过程中每一步提供细粒度过程奖励信号,替代传统仅依据最终答案正确与否的稀疏奖励,从而帮助 GRPO 等强化学习算法更精准地定位推理偏差,提升多步视觉推理能力。
论文提出一种基于句子嵌入几何结构来度量单篇文本语义含量的框架,弥补香农信息论不关注语义、BERTScore 只做成对比较的不足。框架包含三部分:在固定嵌入与基线下由六条公理唯一确定语义度量,并给出标量摘要间的权衡三角关系,为文本信息密度评估提供理论基础。
针对播客和直播中大量未经核查的口头虚假信息,研究者提出 MAD2 基准数据集,专注于多轮音频对话场景下的声明验证。该工作强调对话语境中声明的措辞、强化与未被质疑等动态对可信度判断的影响,弥补了现有事实核查研究主要聚焦孤立文本、忽视对话音频的空白。
arXiv新论文提出SocSci-Repro-Bench基准,包含221个社会科学复现任务,系统评估AI编程智能体在给定原始数据和代码条件下复现已发表研究成果的能力。此前相关评估规模小且混淆了智能体性能与复现材料本身的问题,该基准试图解决这些不足,为衡量AI辅助科学复现提供标准化工具。
论文将结构化序列生成中的多约束联合满足建模为稀有事件顺序推理问题。标准解码方法倾向于高流畅度续写,但难以同时满足所有输入约束锚点。LatticeBridge 结合紧凑前缀语言模型、实例编译的表面自动机与扭曲采样策略,在保证输出忠实性的同时提升约束满足率,为受控生成提供了新的推理框架。
针对自然语言转SQL在真实场景中因问题欠规范、模式庞大而产生的多源歧义问题,本文提出SOMA-SQL框架,通过合成日志和执行探测自动识别并消解用户意图、数据库模式及模型解释三层歧义,避免依赖人工澄清交互,提升NL2SQL在大规模复杂模式下的鲁棒性与准确率。
该论文提出首个将RAG全流程(嵌入、重排序、LLM生成)完整部署在高通骁龙X Elite NPU上的系统方案。针对CPU推理能耗过高的问题,利用移动NPU实现端侧隐私保护、低延迟与离线可用,并提供了完整的系统设计与能效基准测试结果。