来自该信源的全部动态 · 共 981 条
论文提出SeerGuard,面向移动GUI智能体的后果感知安全框架,通过世界模型预测动作执行后的界面状态与潜在影响,在执行前评估风险,弥补现有反应式防护不足,降低误操作造成不可逆后果的概率。
论文针对ARC-AGI-3编码智能体的性能归因问题,比较四种嵌套的Codex智能体配置,分别考察文本基线、可执行世界模型、定期简化与精确回放验证的作用,以厘清哪些机制真正提升抽象推理任务表现。
论文研究用Hadamard变换替代DFT计算循环卷积时产生的代数误差。作者给出三类互补结果,刻画误差的精确抵消、结构来源与位置关系,为理解快速实值变换近似卷积的适用边界提供理论依据。
论文针对欧洲数据空间中用于数据访问、AI治理和数据工作流的 ODRL 策略语言,指出现行标准缺乏数学形式语义,导致各工具解释不一、互操作性受限。作者提出形式化支撑的策略评估器,并与现有实现比较。
论文提出NeurOWL,用大语言模型结合符号推理处理现实中不完整OWL本体的包含关系判断问题。研究聚焦候选但未被蕴含的subsumption是否应成立,面向医疗、生物信息等知识图谱场景,探索LLM补足传统本体推理在缺失知识下的局限。
论文提出 Data Science World Model 概念,并发布 DSWorld,用于在真实执行前预测数据科学操作对环境状态的影响,减少自治数据科学智能体依赖试错带来的计算开销。研究面向自动化分析、建模与决策流程的效率瓶颈。
论文反思将共情等同于情感识别与同步回应的主流做法,提出将共情理解为对预测性错位的容忍与共同调节能力。作者关注长程对话中理解如何经由预测、分歧和修复展开,并尝试刻画对话修复的不同机制状态。
论文提出 Cura 1T 医疗专用大模型,面向患者咨询、临床文本与影像推理、交互式诊断及 EHR 工具调用等智能体场景。作者强调医疗任务能力失效模式不同,单点优化可能损害其他能力,因此需要统一评测与训练以兼顾安全、推理和工作流执行。
论文提出 AV-JEPA,将 LeJEPA 扩展到音视频自监督学习。方法采用早期融合 Vision Transformer,并用模态 dropout 作为掩码,训练全局视图与单模态局部视图的嵌入对齐;SIGReg 目标用于约束表征分布,实现潜空间跨模态对齐。
该论文提出MGDT,用多模态大模型引导扩散Transformer完成多模态知识图谱补全。方法针对既有扩散式MKGC直接在原始多模态特征上去噪导致的噪声条件与语义不一致问题,引入关系自适应MoE,以按关系选择视觉、文本和结构线索并改善跨模态对齐。
论文提出 GraphDx,用知识增强的多智能体框架处理序贯诊断,在迭代收集信息时同时权衡诊断准确率与检查成本。其目标是弥补 LLM 医学知识与成本约束推理之间的缺口,减少过度检测,适用于医疗 AI 决策支持研究。
论文提出一种后验转换方法,将训练好的 PPO 深度强化学习策略改写为可执行 Prolog 逻辑程序。流程包括抽取冻结教师策略、从决策中归纳有序规则列表,并生成可读、可运行、可优化的专家系统,以提升策略可解释性。
论文研究小型本地语言模型在LEED v4.1建筑认证文档初筛中的作用,提出神经符号流程,将项目PDF与信用条款对齐,并把数值阈值判断交给确定性符号模块。结果强调文档中心基准、可验证计算的重要性,也指出多模态输入在部分场景可能降低表现。
论文批判性梳理可信AI工具与信任标识框架,指出现有伦理指南多停留在抽象原则,缺乏可执行机制。研究关注这些工具如何将可信AI落地,并分析从规范设计到实际部署之间的实施断层。
论文提出ToolVerse,用于扩展智能体强化学习环境,覆盖大规模、多样、动态的工具集成场景,旨在提升LLM Agent在真实复杂环境中的鲁棒性、长程推理与工具调用能力,为训练和评估工具增强型智能体提供框架。
论文以学术PDF中的数据集抽取为任务,比较固定LLM工作流与引入反思、记忆等组件的智能体方案,评估这些组件是否带来可观测、可控制的性能改进。研究关注复杂信息抽取中Agent行为调节与可靠性,为工作流设计和评测提供实验依据。
论文提出CRAFT,将基于评分规的评测数据转化为能力诊断工具:通过聚类评分规与失败样本,识别模型表现不佳背后的具体能力缺口,并据此生成有针对性的后训练数据。相比只定位错误题目或类别,该方法试图解释模型为何失败,服务下一轮迭代。
论文提出AgentFAIR,用多智能体协作评估地理空间数据集的FAIR合规性。作者指出现有工具评分口径和证据来源不一致,且易受JavaScript页面、仓库标识符影响;在50个数据集测试中,不同工具归一化得分标准差平均达15个百分点。
论文聚焦互联网梗图中幽默、讽刺与伤害意图交织导致的识别难题,提出多角度推理框架,结合视觉、文本和文化语境生成结构化解释,以提升有害幽默检测的准确性与可解释性,面向内容审核场景。
论文提出SciForge,一个面向科研流程的多模态AI工作台,用统一、可审计的研究状态管理论文、代码、数据集、图表、模型输出与团队决策。系统将图形界面留给人类判断,由AI负责搜索、解析、模型路由与工作流执行,旨在弥合通用助手与真实科研对象管理的缺口。