来自该信源的全部动态 · 共 321 条
研究指出基于LLM的生成式智能体在城市模拟中虽能产出看似合理的移动叙事,但未必符合真实人类移动规律。作者提出一套验证框架,从移动定律、时间节律、网络模体、语义活动转移等维度,将生成式智能体的移动模式与真实世界移动数据进行系统对比评估,揭示当前LLM模拟与现实数据间的差距。
研究指出LLM经过对齐训练后趋于同质化的「乐于助人」风格,导致模拟人类行为时存在Sim2Real差距。团队提出OdysSim,是目前最大规模的行为基础模型开放研究,旨在训练能大规模模拟真实人类行为的模型。同时提出SOUL分类法,从五个维度系统评估行为模拟的保真度,为社会模拟和交互评估提供更可靠的基础设施。
该研究评估了英国和瑞典议会文本中未披露的LLM生成内容的程度。与新闻和学术写作领域已有明确AI使用披露要求不同,议会文本的AI使用披露指南较为模糊。研究旨在通过检测手段衡量议会文本中AI辅助写作的实际渗透程度,为维护公共透明度和公众信任提供依据。
论文提出一种解耦混合专家(Decoupled MoE)方法,将外部知识编码为独立的专家模块注入大语言模型,兼顾检索增强生成的灵活性与参数训练的深度整合优势。该方法避免将新知识写入共享参数,从而减轻灾难性遗忘与知识冲突问题,为领域特定及时效性知识的高效注入提供新范式。
该研究将似然比框架首次拓展至日语文本的作者归属分析。此前该框架仅应用于英文语料,本文融合传统文体计量特征与预训练语言模型嵌入,构建针对日语的作者身份鉴定系统,为法庭文本证据分析提供逻辑与法律上合理的量化依据。
针对罕见病诊断面临的数据分散与隐私限制问题,提出MedLatentDx框架,利用多智能体间的潜在空间通信实现跨医院协作诊断。该方法允许各机构在不传输可识别临床文本的前提下共享病例特异性诊断证据,解决了隐私法规对机构间数据流通的约束,为覆盖7000余种罕见病、3亿患者的分布式诊断提供了新路径。
该研究质疑当前将LLM视为具有稳定模型级偏好和价值体系的评估范式。作者指出现有鲁棒性检验仅限于语法变体、选项重排等偶发扰动,未考察任务上下文变化的影响。实验表明,当部署场景改变时,模型表现出的偏好与价值会显著重塑,说明所谓「稳定人格」可能是测量伪迹而非模型固有属性。
该研究针对自动化ICD编码任务,系统评估了任务特定后训练对生成式大语言模型医学编码能力的影响。此前研究多在推理阶段(提示、检索、重排序、工具调用)测试LLM,普遍认为其编码能力较弱。本文通过控制实验探索后训练策略能否显著提升LLM在计费、流行病学及临床决策支持场景中的ICD编码表现。
该论文延续「创造力即压缩」的研究脉络,为「创造性整合」给出可操作的判定准则:在固定描述语言下,当对冲突 A 与 B 的解决方案能使联合描述长度严格缩短时,该方案即构成创造性整合。该标准可判定,为评估创意方案是否真正降低描述复杂度提供了形式化工具。
现有编码智能体基准仅评估全自动模式,忽略了实际交互场景。该论文提出 Dialogue SWE-Bench,构建自动化基准数据集,用于评估编码智能体通过与用户对话协作解决真实软件工程问题的能力,引入基于角色设定的对话模拟方法,填补了对话式编码助手评估的空白。
该研究提出一种混合经典-量子变分自编码器(VAE)用于主题建模,将参数化量子电路嵌入VAE推理网络,同时保留经典的主题-词解码器。为应对量子硬件资源约束,提出改进的高斯Softmax方法。作为概念验证,探索量子计算与神经主题模型结合的可行性,属于量子NLP交叉领域的早期探索工作。
CacheRL提出一套训练小型Agent基础模型的系统,在多步工具调用任务上达到92%过程准确率,接近GPT-5的94%,但所需计算量仅为后者的1/100。该方法解决三个核心问题:从大模型大规模迁移工具调用知识、通过缓存rollout实现无需实时工具执行的强化学习、以及在噪声环境下利用混合奖励进行鲁棒训练。
针对数据湖上探索性问答(EQA)任务,端到端准确率无法区分搜索、规划、数据分析及动作策略各环节的失败原因。本文提出SANA诊断消融框架,通过系统性隔离Agent各模块,定位大规模数据湖场景下QA智能体的真正瓶颈,为改进Agent设计提供可操作的诊断依据。
当前大规模自动语音识别系统通常被优化为忽略语音中的不流畅现象(如犹豫、重复),导致信息丢失和幻觉。该研究提出基于持续学习的方法,使模型在有限数据集上适配不流畅语音标注能力的同时,避免对通用领域知识的灾难性遗忘,兼顾逐字转录精度与通用识别性能。
研究对GPT-4o-mini和GPT-4.1-mini在29个任务上进行重复评估实验,每题50次配对试验和50次逐点试验,并辅以温度和提示敏感性消融分析。结果表明LLM-as-a-Judge的运行间一致性远低于预期,存在显著的随机性和系统性偏差,对当前依赖此方法的模型排名、奖励模型训练和公开排行榜的可靠性提出质疑。
该研究提出GAMA-Bench基准,包含1298个性别镜像场景,覆盖亲密关系与公共社交冲突,评估LLM在相同负面行为下对男性与女性行为者是否施加一致的道德判断标准。研究发现LLM在道德归因上存在性别不对称现象,对男性行为者倾向给出更严厉的评价,揭示了超越刻板印象层面的深层性别偏差问题。
该研究指出当前文化对齐方法过度依赖推理时干预,假设模型已具备充足文化知识。作者提出LLM管线存在「文化数据漏斗」问题,通过多维标注框架分析预训练、微调、对齐及推理数据集后发现,显式文化信号在后训练阶段急剧下降,数据被地理集中化和任务专业化内容主导,导致文化对齐从源头受限。
研究发现RL训练的LLM Agent缺乏对任务进度的元认知能力,在线进度提示反而损害性能,而回顾式示范有助于改善。团队提出RePro框架,通过回顾式进度感知训练使Agent在长程任务中获得自我精炼能力,弥补结果奖励训练无法涌现进度意识的缺陷,提升长视野任务的扩展性。
该论文指出医疗体系围绕每年约1小时的临床就诊设计,而真正影响长期健康的8759小时日常行为(饮食、睡眠、运动、用药、压力)缺乏基础设施支撑。作者认为个性化健康的瓶颈不在数据或推理能力,而在基础设施层缺失,提出将健康管理作为日常基础设施的框架。
该研究提出DLawBench基准,聚焦律师-客户多轮咨询场景,评估大语言模型在法律推理、事实引导与信息获取方面的综合能力。基准要求模型不仅具备法律知识,还需通过策略性多轮对话从客户处获取关键事实,以制定最优法律方案,填补了现有法律基准在交互能力评估上的空白。