来自该信源的全部动态 · 共 1211 条
研究利用新西兰奥克兰植物标本馆的数字化生物标本记录,识别采集地点描述中未被现有地名词典收录的非标准地名,并结合历史语境与区域地理信息进行地理定位。该方法可挖掘自然史档案中的时序地理知识,为历史地名恢复、生物多样性数据治理和地理信息检索提供支持。
该论文研究如何在不同话题和媒体类型中自动发现概念隐喻,关注抽象经验如何通过具体经验被框定,并影响公众推理。工作属于计算语言学与话语分析交叉方向,可用于舆情、政治传播和社会科学文本分析。
论文研究错误预设问答中常用的「抽取预设再逐项核查」方法,指出现有评测过度关注含错误预设的问题,忽视正常问答场景。弱预设验证虽提升专项基准表现,却可能导致模型过度纠错或拒答,损害通用问答能力。
论文研究人格条件化LLM智能体在经历生活事件后的性格演化,关注其是否能保持长期一致且符合心理学规律。作者提出分析框架与基准,用于评估不同情境、事件对智能体人格变化的影响,为情感陪伴、社会模拟和角色扮演中的长期Agent设计提供测量工具。
论文提出 TradeVerse,用于评估大模型理解国际贸易政治谈判的纵向能力。该基准强调多轮谈判中立场对齐、争议演化和前文依赖,弥补现有基准多聚焦单文档或单任务的不足,面向制度与政治文本场景。
论文介绍Stockmark-Nemotron-3-Nano-Omni-JapanDocReader,一款基于Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16构建的日文文档理解模型。研究通过能力注入向推理型多模态模型加入结构化文档解析能力,并采用遗忘控制,尽量保留原有文档视觉问答能力,探索模型能力扩展与性能保持之间的平衡。
论文发布 ConstructCIE,一个基于 OSHA 建筑事故报告人工标注的数据集,面向事故叙事中的因果信息抽取。其层级标注覆盖事故类型、致因因素、子因素和证据片段,并评测序列标注模型与指令微调大模型。
论文研究在文档字段抽取前,用低成本文档信号预测任务难度,并在便宜模型与强模型间路由。结果显示,路由只有在便宜模型失败率足够高、难度预测足够准等条件满足时才带来成本收益。
论文提出用于评估音频语言模型的反事实审计方法,检验模型在评价语音交互系统时是否真正利用情感、韵律及情感转变时机等副语言信息。方法保持转录文本不变,仅改变音频线索,从而区分模型对语义内容、回答风格与声学证据的依赖,为语音模型评测提供更严格的诊断框架。
论文提出 Ask-E,用于生成与模型当前能力前沿相匹配的问题。研究指出,高质量评测题不仅要超越既有问题分布,还需准确控制难度并理解模型完成任务所需的解题能力,从而支持更有针对性的训练、评估与能力边界探测。
论文提出FutureBridge,用于大模型辅助小模型的协同解码场景。不同于仅依据大模型下一词偏好或干预词选择,该方法评估LLM-SLM联合候选词对小模型后续生成的可延展性,试图降低局部最优选词带来的连贯性和续写难度问题。
论文指出标准RAG会受检索文档自带语体影响,专业术语、正式或学术语气可能先于提示词塑造回答风格,导致模型忽视用户指定语气。作者提出将语气感知作为RAG设计要求,关注检索、重写与生成环节的风格控制。
论文研究智能体记忆压缩为何会丢失「可能、据称」等认知立场。作者用匹配笔记控制声明与立场一致,仅改变立场位置,在相同预算和干扰笔记下压缩,并由盲评读者评分,分析显式性与位置对立场保留的影响。
论文提出 LLMRouter,将大模型路由统一表述为序列决策过程,拆分为上下文编码器、模型编码器、评分函数、决策规则等核心组件,旨在解决现有路由器实现分散、难以公平比较和扩展的问题,并为开发、评测与部署提供统一基础设施。
论文提出GRASP,用Group Relative Policy Optimization训练语言模型匿名器,目标是在不依赖推理时强模型攻击者、不把私密文本交给第三方的情况下,降低文本中年龄、地点、职业等敏感属性泄露风险,并保持可用性。
论文研究在线策略蒸馏中预热阶段的作用,指出有效预热依赖与教师模型兼容的思维链监督,甚至错误教师轨迹也可能带来相近收益,并从数据与训练角度分析影响OPD效果的关键因素。
论文分析掩码扩散语言模型中的软掩码机制,指出现有线性插值默认原始嵌入空间具有欧氏结构。实验发现,掩码与预测词嵌入在训练期间始终保持约73度夹角,范数基本不变,导致预测反馈效果受限,并为改进插值方法提供几何学依据。
论文提出MTI-GNN,将贝克认知三元组中的自我、世界、未来负面视角建模为互补分类信号。方法先用LLM把话语分解为三类心理视角,再通过三元交互图神经网络进行认知扭曲检测,面向计算心理健康场景。
论文提出Autonomy-of-Heads,面向长上下文LLM推理的二次注意力与KV缓存瓶颈。方法利用冻结模型的Query-Key几何,在无需校准数据、运行时注意力分数或学习门控的情况下识别检索头与流式头,以降低稀疏注意力部署成本。
该研究提出一个反向问题:能否仅依据大语言模型在图片命名任务中的错误模式,推断其内部遭受的损伤位置与程度。研究者将模型损伤后生成的错误画像与卒中失语患者表现对照,探索行为数据能否识别导致特定语言障碍的因果参数,为连接模型可解释性、神经语言学和因果诊断提供新方法。