来自该信源的全部动态 · 共 981 条
论文提出REFORGE,用于评测大语言模型在反编译二进制函数命名中的逆向工程能力。作者指出现有基准常把函数级真值构建视为已解决预处理,准确率报告缺乏透明度,难以衡量模型在真实攻防工作流中的实际表现。
该论文提出SAGEAgent,用于多模态肿瘤生存预测中的诊断模态选择。它不再假设所有检查数据可用,而是按临床负担递增顺序主动判断是否需要追加影像、基因组等模态,在预测准确性与检查成本之间权衡,面向更现实的医疗决策场景。
论文提出量子化拔河决策模型QTOW,用三能级内部状态、守恒更新与测量扰动刻画决策、学习和探测操作,分析何时可用单一最小内部状态表示违反经典概率的情境依赖决策现象。
论文提出TrustX Agent风险分类框架ARC,用于对企业和公共部门内部创建的Agentic AI系统进行结构化风险分级。框架覆盖七类Agent系统,借鉴既有AI治理框架,强调可重复评估与治理落地。
论文关注已部署LLM智能体的外部控制上下文,尤其是可随运营经验持续更新的系统级指令。作者指出,长期以纯文本方式累积和维护指令会导致交互复杂、验证困难,并研究在分布漂移下用局部化验证提升长程上下文演化可靠性。
论文提出MedRealMM,一个面向中文在线医疗咨询的真实世界多模态基准,针对现有评测依赖合成对话、缺少患者上传影像、指标难反映临床质量等问题,评估大模型在开放式问诊场景中的医疗理解与回复能力。
论文提出用「交互」统一分析大语言模型知识蒸馏机制,将模型输出分解为多组输入变量的非线性关系,以比较不同蒸馏方法的共同作用路径,为解释蒸馏为何有效及改进训练策略提供分析框架。
论文提出面向工业物联网与运营技术安全的神经智能体控制框架,试图结合深度学习与LLM语义推理来控制安全控件,同时针对LLM幻觉在闭环控制中的安全风险设计约束机制,替代单纯规则监控。
这篇综述系统梳理医疗大模型在临床推理与患者护理中的进展,提出连接临床实践与计算方法的双视角框架,并基于Miller金字塔构建五级能力体系,用于评估医学LLM从知识掌握到真实临床应用的能力要求。
论文聚焦智能机器人假肢与人体长期耦合带来的隐私问题,提出「Idiobionics」概念,试图将隐私保护纳入仿生肢体的感知、响应与日常使用设计,为医疗机器人和人机融合系统提供治理框架。
论文提出「具体化命题提示」CPP,将问题相关命题显式具体化,以缓解大模型在组合推理与知识准确性之间的矛盾。实验显示,CPP显著提升推理表现,尤其在医学等依赖精确知识的基准上效果突出。
论文提出CausalDS基准,面向具备工具调用能力的数据科学智能体,评测其在真实数据分析流程中的因果推理。它弥合符号因果题与普通数据分析题的断层,用于检验LLM代理能否理解因果生成机制、选择方法并解释结果。
论文提出「先竞争后协作」多教师蒸馏框架,让Claude、Codex-GPT、Grok、Gemini通过执行结果评测两两排名,再协同生成可验证编程课程,用于训练小型代码模型,减少LLM裁判自偏置并提升超越模仿的能力。
论文提出将答案集编程与能量模型模块化结合的神经符号推理学习方法,在连续潜空间中进行联合优化,同时保留ASP的声明式语义、背景知识、约束和非单调推理能力,面向可解释且可约束的学习系统。
论文提出 MentalHospital,用于评估大语言模型在完整精神科临床会诊中的表现,覆盖主观访谈、客观检查、诊断评估与治疗规划等环节,弥补现有基准多聚焦单点任务、缺少流程化模拟的问题。
论文提出将大模型「人格」视为行为特质空间中的位置,用OCEAN五因素框架描述开放性、尽责性、外向性、宜人性和神经质,并通过低秩适配器放大和测量特质,为模型行为分解、安全评估与可控对齐提供工具。
论文提出一种面向前臂表面肌电信号的图表示方法,将肌肉激活模式建模为图网络,用于实时手势识别。目标应用包括先进假肢无缝控制和增强现实交互,重点在提升识别准确性与即时响应能力。
论文提出一款AI工具,将GTAP经济模型与APSIM生物物理模型结合,用于分析农业供应链冲击。系统支持自然语言问答,帮助政策制定者和市场参与者评估灾害、市场波动等扰动在跨学科系统中的影响。
论文尝试用数学框架刻画思考与感知,从可观测空间和潜变量空间的概率分布提升与投影出发,形式化推导慢思考与主动感知机制,并讨论慢思考大语言模型的设计、训练与推理,为认知功能建模提供理论基础。
论文提出 ASMR,一个用于船舶维护与运营报告写作的模块化智能体框架,可从多类别历史表单中自动发现紧凑且信息充分的模式。系统包含字段生成与后续专门代理,面向结构化报告需求抽取,适合关注垂直行业文档自动化与智能体流程设计的人参考。