来自该信源的全部动态 · 共 677 条
论文介绍QANTA 2026共享任务方案,面向逐步揭示文本与图像的Quizbowl问答,在效率约束下结合置信度校准与增量推理,分别处理抢答时机和多模态证据利用问题。
论文提出 WILDTRACE,用于评测长文档复杂问答中的自然证据链推理能力。其关注证据在原文内部跨远距离段落分散出现的场景,要求模型整合多处线索并给出可追溯依据,旨在补足现有长上下文评测偏合成或检索导向的不足。
论文关注端到端生成式任务型对话中的一致性检测问题。LLM在餐馆、城市等依赖领域知识库的场景中仍可能幻觉,导致回复与知识库不符。研究旨在识别系统回答中的事实或约束违背,为对话系统可靠性评估提供方法。
论文研究法证场景下的作者验证,将两段文本是否同一作者的证据强度量化为似然比。作者提出基于归一化的似然比估计方法,旨在减少传统评分法对额外校准模型和案情相关数据的依赖,提升证据量化的可用性。
论文指出现有RAG评测只验证回答是否由检索文档支持,却忽略证据是否归属到正确实体。在临床场景中,模型可能把药物Y的证据当作药物X引用,仍通过忠实度、幻觉和引用检查,作者将其定义为欺骗性grounding,并提示需新增实体归因评估。
论文研究面向实时部署的句子级手语翻译,而非提出新架构。作者在How2Sign的9872条均匀采样子集上微调SHuBERT-ByT5翻译栈,关注计算、存储约束下的可用性与延迟表现。
论文发布 Soofi S 30B-A3B,一款面向德语和英语的开源主权基础模型。它采用 MoE 混合 Mamba-Transformer 架构,每 token 仅激活 30B 参数中的 3B,并在长上下文下保持近恒定推理缓存,强调高并发部署吞吐优势。
论文提出将音素切分与识别统一处理,认为自监督语音模型的表征中已潜藏音系结构。方法使用基于S3M的音系激活映射,将每帧语音表征转为音系特征激活向量,用于引导两类任务,面向低资源或可解释语音处理场景。
论文研究大规模文学与历史文献的自动主题索引,以伏尔泰全集两个子语料为测试对象,用机器学习为文本片段分配结构化概念标签,旨在降低人工编目成本,提升学术版本的检索与访问效率。
论文介绍Freya-TTS,一款面向土耳其语会话合成的紧凑型无分词器TTS模型。其采用183.2M参数非自回归条件流匹配DiT,在AudioVAE2冻结连续潜空间中完成文本到潜变量映射,以提升合成可靠性与效率。
论文提出VTaMo手语翻译框架,针对无Gloss方法仅依赖翻译监督导致跨模态对齐不足的问题,引入多粒度显式对齐。其局部层使用带可学习空标记的熵正则最优传输,以提升连续手语视频到文本的细粒度映射能力。
论文提出面向公司基本面分析的RAG系统,整合企业报告、宏观经济数据及SEC EDGAR文件,经预处理后调用GPT-4o生成投资者简报,探索大模型在财务信息检索、摘要与投资分析辅助中的应用边界。
论文系统复现实验涌现失准现象:模型在狭窄错配数据上微调后是否会突然表现出广泛不对齐,并研究有限再对齐能否逆转。作者通过重复对齐/失准循环、受控微调与LoRA表征追踪,检验该现象的稳健性与机制。
论文研究面向陪伴型助手的小型双曲语言模型,指出个性化记忆会让模型形成可能伤害用户的特质,而人工评估一致性很低。作者声称在小模型中观察到创造性、诚实和可设计遗忘等现象,试图为伴侣型 AI 的人格演化与安全评估提供新工具。
论文提出 HALO,用少量自适应额外计算增强冻结预训练语言模型。方法在骨干隐藏状态上按需执行潜在空间细化,避免固定多步全序列推理带来的算力浪费,并在一阶细化能力不足与二阶计算过重之间取得平衡,面向迁移与推理效率优化。
论文研究测试时扩展是否适用于小型开源视觉语言模型,在EXAMS-V多语视觉选择题基准上比较自一致性、先描述后推理、PRM引导束搜索及事后选择器,覆盖Qwen2.5-VL-7B-Instruct与Qwen3.5-4B,指出运行条件比搜索策略本身更关键。
论文探讨用有界、具名算子构建天然可读的 Transformer,使其更像模糊集合操作而非稠密激活。作者指出训练中推动算子变清晰会出现失效:清晰度惩罚可能把检测器压成无效常数,并用恒等式解释其机制。
论文提出DKCD框架,面向医疗、金融、教育等高专业领域,从非结构化文本中进行因果发现。方法强调引入领域知识,弥补仅依赖LLM通用知识识别因果因素和构建因果图时的不足,目标是提升因素抽取、结构化标注与因果关系推断的可靠性。
论文研究LLM推理中的MLP激活稀疏化与token级条件路由,提出SATS按层校准门控阈值,用局部MLP输出敏感度替代统一阈值,以在减少计算时尽量保持模型质量,并分析稀疏化与路由策略的权衡。
论文提出AgentKGV,用于大规模知识图谱事实验证。该框架结合LLM与RAG,引入动态路由和迭代查询改写,以缓解文档表述不一致、检索噪声和抽取错误,并通过两阶段训练提升验证可靠性。