来自该信源的全部动态 · 共 981 条
论文聚焦大模型预训练中的能力优化难题:数据只在训练前影响能力,评测却在训练后以噪声分数呈现。作者提出连接样本、提示、解码与评分规则的数据—评测闭环,用于从失败案例反推语料修复方向,提升能力迭代效率。
IMCBench 是一个面向医学场景的图像 grounding 多轮对话基准,旨在弥补现有医学 AI 评测中「有对话无图像」或「有多模态但仅单轮问答」的缺口。该基准用于评估多模态大模型在临床图像理解、交互式问答与决策支持相关任务中的能力。
论文审计离线根因分析基准的报告方式,指出跨多个子系统汇总的Top-1准确率会误导工程师,将总体赢家误读为本系统最佳方案。研究覆盖OpenRCA、RCAEval、PetShop的11个子系统与778个匹配评分单元。
论文构建两期模型分析企业部署自主AI时的任务分配:AI正常时可能优于员工,但存在失效概率。让员工保持参与会牺牲短期产出,却影响未来人力资本;员工流动性进一步改变企业对「人类后备」技能投资的激励。
论文提出基于真实临床即时查询的盲评框架Real-POCQi,收集OpenEvidence平台620个医生实际问题,并加入187个HealthBench问题,由149名执业医生参与评估,旨在弥补临床AI长期依赖考试题或假设题评测的缺口。
论文提出 HyphaeDB,将向量数据库常用的 HNSW 图从检索优化结构重新解释为智能体间知识传播的通信拓扑,使记忆层不再只是被动存储,而能支持多智能体共享、扩散和演化知识,为 Agent 长期记忆基础设施提供新设计方向。
论文提出Flow Reasoning Models,用训练与测试时扩展框架改造离散流模型,使其在数独、斑马谜题等结构化推理任务中通过迭代自我修正减少自信错误,提升少步文本生成模型的推理可靠性。
论文提出 GPTNT 基准,基于合作游戏「Keep Talking and Nobody Explodes」评估多模态模型在实时协作中的表现。该任务同时包含时间压力、信息不对称与不完美沟通,弥补现有基准多将协作能力拆分评测的不足,适合研究人机或多智能体协同能力。
论文提出ATHENA-R1,用于在覆盖1939年以来全部FDA批准药物的工具宇宙中进行治疗推理。该智能体围绕疾病背景、合并症、用药禁忌和证据更新迭代筛选疗法,并强调可验证来源,面向临床决策支持的复杂约束推理场景。
论文研究在形式公理系统中,智能体能否不依赖数学文本、代码或定理库等人类先验,通过自监督方式自主发现有用定理。工作聚焦数学推理系统的自主性与定理发现机制,为评估LLM之外的数学探索能力提供实验框架。
论文研究LLM推理链中的「真」表征几何,指出CoT和Wait提示只促使模型多思考,未必导向正确答案。作者提出动态表征编辑框架,在推理展开过程中调控内部表示,以引导推理轨迹更接近真值。
论文评估冻结医疗大语言模型表征能否作为共享嵌入空间,融合临床叙事与结构化电子健康记录变量,用于预测主要诊断ICD类别。研究聚焦自动编码在多模态诊断信号整合上的局限,为医疗编码与EHR建模提供实验参考。
论文指出,将聊天机器人时代的拒答机制直接用于智能体安全是范畴错误。智能体风险来自工具调用、转账、删改记录等行动后果,安全目标应从内容拒绝转向行动对齐,避免以能力损失换取表面安全。
论文讨论国际人道法中平民「直接参与敌对行动」的直接因果标准,指出当平民部署自主多智能体网络系统时,伤害结果与个人行为之间的因果链被AI中介重塑,现有ICRC三要件测试面临适用困难。
论文提出COMPASS,将构图感知与构图引导生成整合进统一多模态框架,针对主体位置、场景组织等高层视觉意图进行建模,缓解现有模型在细粒度构图识别和可控生成上的不稳定问题。
论文提出 VirtueMap,用亚里士多德德性伦理框架分析大语言模型在伦理权衡中的偏好。方法不追求单一正确答案,而让人类或模型对多种回应排序,以观察公平、诚实、勇气、克制等价值取向,为模型安全与价值评估提供可解释维度。
论文对低/无代码自动化平台n8n中的LLM智能体工作流做大规模实证研究,分析用户如何组合模型、外部服务与API完成多步任务,刻画工作流结构、使用模式与潜在风险,为Agent平台设计、安全评估和工具集成提供数据依据。
论文提出BV-Blend,用不确定性加权的历史奖励基线改进GRPO类无评论家RLVR优势估计,缓解组内奖励统计失效导致的不稳定,在减少价值模型开销的同时提升大模型对齐训练稳定性。
该论文针对通用大模型在交通工程标准、术语和领域语义上覆盖不足的问题,提出定制生成式AI智能体的系统开发方法,并强调通过持续预训练增强专业问答、总结和推理能力。内容更偏工程领域模型适配与落地流程参考。
论文提出「Agentic Abstention」问题:在目标不明确或环境不可达时,LLM智能体应判断继续调用搜索、浏览或终端工具是否无益,并选择停止行动。研究聚焦多轮工具使用中的不确定性与可靠性,为智能体安全评测和停止策略设计提供新框架。