来自该信源的全部动态 · 共 981 条
论文提出 Causal-Audit,面向因果与干预问答构建目标感知因果链,将大模型隐式语言推理转为显式、可审计的图结构推理路径,以降低因果假设不透明、推理不可验证和复杂干预下预测脆弱等问题。
论文提出 AnovaX,一款本地优先桌面语音助手,在用户电脑上运行语音唤醒、识别、LLM 规划、工具执行与安全过滤。系统用 Gemini 生成 JSON 工具调用计划,结合类型化执行器、白名单/黑名单和自适应恢复,将桌面作为操作界面,关注隐私与可扩展技能。
论文指出前沿AI公司公布的能力阈值差异较大,第三方难以验证是否越线,也难以横向比较安全要求。作者提出一种跨三个风险领域推导统一最低阈值的方法,旨在减少缓解措施不一致和安全标准下探风险。
论文提出 DrawingVQA,用于评估多模态大模型在真实施工图上的视觉-文本推理能力。该基准覆盖抽象几何、符号标注、表格、注释和工程术语等复杂信息,面向建筑、土木等工程场景,补足自然图像和简化平面图评测难以反映专业图纸理解能力的空白。
论文提出S1-Omni,面向AI for Science的统一多模态推理模型,试图整合科学理解、预测与生成能力,解决现有领域模型、工具增强LLM和科学语言模型能力割裂,难以联合建模异构数据、科学规律与专家知识的问题。
论文讨论逻辑与优化在规则型AI中的结合:逻辑适合编码规则库并进行推理,优化可作为高效计算推理的技术路径。作者强调,在AI透明性、可复现性、可解释性、可信与公平性需求上升背景下,规则型AI重新具备现实意义。
论文检验多智能体数学推理中「专职评审能把错误答案改对」的常见假设。在4181道带验证器的Omni-MATH题上,用匹配的gpt-oss-120b智能体测试发现:简单题协作增益有限,难度4级后收益扩大;但评审精确指出问题并不必然带来批评被采纳。
这篇论文研究在政治新闻推荐中提升用户系统控制权的影响。作者设计可展示并调节政治倾向的推荐界面,用于帮助用户识别和干预过滤气泡,评估其对内容多样性、用户感知与选择行为的作用。
论文聚焦 ComfyUI 等视觉创作系统的工作流生成,指出直接用 LLM 生成 JSON 容易结构脆弱且缺乏专家经验。作者提出以知识建模为核心的智能体方法,将模块组合、设计经验与推理过程显式化,以提升工作流的正确性和可用性。
论文介绍 EZSMTV3 的设计与实现,这是一个可扩展的基于 SMT 的约束答案集编程框架,结合 ASP、约束处理与 SMT,强化将 CASP 问题翻译求解的路线,面向复杂组合搜索问题的声明式建模与求解。
论文提出AgentCompass,一个开源、轻量、可扩展的LLM智能体评测基础设施,旨在解决现有评测流程碎片化、耦合高、复现难和重复工程问题,为智能体能力评估提供统一组织与扩展机制。
论文提出SPINE,即可扩展物理集成与智能体专家框架,面向双臂机器人系统化调试与部署。它将基础模型决策能力与物理平台校准流程连接起来,试图减少专家手工调参,解决具身AI从模型到真实机器人落地的「脊髓」瓶颈。
论文提出 LAPO,用后向留一轮归因生成过程监督奖励:将每个搜索轮次及检索观察替换为固定占位符,衡量对当前策略表现的影响,以区分有用、冗余和有害交互,改进仅依赖终局奖励的多轮搜索推理强化学习。
论文提出在贝尔纳普类型化内涵一阶逻辑IFOL_B框架上,引入Nilsson概率结构,为当前未知命题计算概率,以增强神经符号AGI机器人的推理能力。工作偏重形式逻辑与认知架构,旨在结合神经学习、符号推理、自指与不确定性处理。
这篇综述将自我改进自治智能体视为能从经验中积累能力增益的自适应系统,讨论其系统框架、基础模型与操作环境耦合、经验转化机制,以及在少量或无人干预下实现可控演化的关键挑战。
论文提出 CAVA,用于在智能体系统的异构运行时中统一描述、验证和证明关键操作。它试图把代码发布、身份变更、资金转移、数据导出等动作从不同日志和工具记录映射为规范动作,以支持审批追踪、合规审计和运行时治理。
论文研究生产微服务故障中的根因分析,聚焦指标、日志、链路追踪等多模态遥测数据。作者以OpenRCA数据集为例,指出现有经典方法与LLM方法在缺少领域知识、数据规模大且模态复杂时准确率普遍偏低,并评估因果发现等路线的实际能力边界。
论文提出STOCKTAKE,用于评估LLM智能体在多周决策任务中的失败来源。该方法引入「公平预言机」,避免参考策略读取智能体不可见的特权状态,从而区分智能体是误读环境,还是理解正确却未能行动,聚焦「知行差距」的可测量性。
论文提出 UESF-Bench,面向语言引导的人类目标寻找与持续跟随任务。相比默认目标初始可见的既有基准,该基准要求具身智能体先根据语言描述定位目标,再在动态环境中保持跟随,用于评估更贴近现实的人机导航能力。
论文提出干预式扎根审计,用黑盒方式检验LLM思维链是否真正依赖前提。方法替换单个前提中的目标谓词为新符号,重跑模型,并比较各推理步骤的规范化结论是否随之变化,以定位表面合理但未被前提支撑的推理。