来自该信源的全部动态 · 共 1190 条
论文提出将开源大模型的权重空间谱特征视为模型「生物识别」指纹,用于识别模型来源、所有权和演化关系。研究面向多阶段训练、微调和衍生模型带来的谱系复杂性,强调其在模型溯源、治理与供应链完整性中的作用。
论文提出多层组合融合框架做上下文价值对齐,试图超越单一奖励和单智能体对齐方案,以适应伦理多元、不同情境下的价值冲突,并更贴近多智能体道德推理与动态决策场景。
论文提出IntelliAudit,一个面向IT审计的检索增强多智能体系统,用大模型判断分散在政策、记录、表格和运营材料中的证据是否满足安全与合规控制,重点解决审计结论依赖证据充分性而非关键词匹配的问题。
论文提出「能力阶梯」课程框架,用于应对AI快速改变计算岗位任务结构的问题。作者基于劳动力市场与软件工程证据综述,并以探索性试点课程作说明,强调近期课程应围绕可迁移能力、AI协作与任务重组进行更新。
论文针对医院在分诊、文档、排班和收入周期等流程中部署AI易碎片化、难治理的问题,提出Agentic AI模式目录与编排框架,强调从单一聊天机器人转向受治理的Agent生态,以降低生产环境风险、技术债和关键医疗系统的运营脆弱性。
论文提出一种面向 text-to-SPARQL 的研究者智能体系统,用于将自然语言问题转换为可在大型知识图谱上执行的查询。系统在每轮推理后基于验证反馈继续检索、消歧、实体与本体对齐,并生成语法有效且语义一致的图模式。
论文提出Mendel Gödel Machine,用比较进化和受控继承机制改进自我重写代码的智能体。不同于仅基于单次失败轨迹的自修改方法,MGM利用历史尝试档案中的对比信号,面向编码任务提升递归自我改进能力。
论文讨论评估型AI如何通过呈现相互竞争的假设及正反证据辅助人类决策,主张以计算论证作为形式化、可计算基础,以增强系统的可解释性与可质疑性,并为长期研究路线奠定框架。
论文提出MetaSpace,用变形测试评估具身智能体的空间认知能力,试图弥补人工VQA标注成本高、任务成功率指标掩盖细粒度缺陷的问题,为导航和操作类智能体提供更系统的鲁棒性诊断方法。
论文提出 Agent-MD,在长周期分子模拟任务中只在建流程和事件触发时调用大模型,其余续跑、分析、归档由常规流程处理。框架强调状态保持、来源可追踪、适应性评估,以及对无法用固定规则安全处理的异常条件进行人工审查式介入。
论文指出LLM基准结果影响企业声誉与市场预期,但厂商评测常依赖自证,存在模型变更不披露、结果不可复验等问题。作者讨论以去中心化机制提升评测透明度、可验证性与独立监督。
论文研究LLM智能体在供应链采购谈判中的行为,让拥有私有需求信息的买方与不知情卖方协商数量和付款合同,并用完美贝叶斯均衡作基准,对OpenAI、Google、阿里等九个模型进行评估,关注价值创造、分配稳定性与亏损合同风险。
论文研究在需求不均、随时间变化且可能超过供给时,如何将单一守恒容量预算分配到多个地点和两类服务。作者提出两级算法:先在地点内重分配容量,再在服务等级间协调,适用于边缘限流、租户吞吐许可和出口带宽等资源调度场景。
论文提出一种面向眼底照相青光眼检测的Agentic AI框架,将LLM初步判断与图像质量、专科深度学习工具的函数调用结合,旨在缓解LLM在医学影像中的幻觉、准确率不足和运行不一致问题,并进行了验证。
论文从技术与法律视角分析临床基础模型的隐私风险,指出模型可能泄露训练数据中的敏感患者信息,导致再识别风险,且现有数据处理合规框架难以覆盖模型介导泄露。文章讨论风险量化、监管边界与保护措施。
论文将多智能体系统中的智能体选择与通信链路建模为合作博弈,针对任务条件下的净效用权衡能力收益、token成本、延迟、冗余与错误传播,旨在替代固定通信或全广播架构,为技能型Agent协作提供更高效的联盟形成和通信定价机制。
论文提出 QuantumMind,用固定的类型化、角色专门化智能体流程生成并保守筛查量子加速假设。它强调保持任务定义、访问与输出模型一致,显式暴露前提承诺,并限定复杂度论证范围,以提升量子速度提升分析的可审计性。
论文提出AndroidReality,一个基于扰动的移动智能体评测与改进框架,用MDP视角组织真实界面变化与不完美交互条件,旨在衡量智能体从AndroidWorld等干净基准迁移到现实手机环境时的鲁棒性差距。
论文提出TREAT基准,评估AI系统在数学定理条件经等价变换后,能否识别其对应的标准定理身份。该任务聚焦模型从灵活自然表述连接到形式化对象的能力,可用于检验形式知识访问、定理理解与下游工具调用的鲁棒性。
论文提出面向四足机器人导航泛化研究的AI Scientist闭环,在仿真中自动设计、运行和分析机器学习实验。方法针对自主研究循环易围绕指标做局部优化的问题,引入结构化假设、品味约束和可证伪发现,以减少研究漂移。