今日AI焦点集中在智能体能力升级与落地评测:Anthropic发布更强的Claude Sonnet 5,同时出口管制松动;OpenAI、IBM、英伟达围绕科研与企业迁移推出基准/工具。产品侧,Google NotebookLM把资料摘要推向短视频形态,移动端与创作工具也在加速嵌入AI。
Anthropic在X上介绍Claude Sonnet 5,称其为迄今最具智能体能力的Sonnet模型。新模型可自主制定计划,调用浏览器、终端等工具,并以更低成本达到数月前需更大模型才能实现的自主运行水平。
sim-use 是 lycorp-jp 新开源的移动端 Agent 自动化项目,面向 iOS 模拟器和 Android 模拟器/真机,通过无障碍与移动自动化能力,让 AI Agent 获取视觉输入并执行点击、输入等操作。
Google NotebookLM新增AI视频摘要功能,可根据用户上传资料生成60秒竖屏短片,风格类似TikTok,用于快速回顾笔记与研究内容。该功能正向Google AI Ultra和Pro订阅用户推出。
IBM Research 在 Hugging Face 发布 ScarfBench,用于评测 AI 智能体在企业 Java 框架迁移中的能力,聚焦真实代码库、依赖升级与框架替换等复杂任务。该基准有助于衡量代码智能体在遗留系统现代化场景的可靠
英伟达宣布 BioNeMo Agent Toolkit 接入 Anthropic 的 Claude Science 科研工作台,为生命科学研究智能体提供加速模型、库和微服务调用能力,覆盖基因组分析、蛋白质结构预测、分子设计等流程。英伟达称前
Anthropic表示,美国商务部已解除对Claude Fable 5和Mythos的出口管制,公司计划自明日起逐步恢复访问。该决定结束了数周与特朗普政府的谈判,意味着此前被长期搁置的模型服务可重新上线。
TechCrunch报道称,布拉格AI实验室EquiLibre Technologies由三名前DeepMind研究员创立,团队曾开发扑克AI。公司将博弈与机器学习技术用于量化交易服务,估值已超过5亿美元。
OpenAI发布GeneBench-Pro,一个面向研究级计算生物学任务的智能体评测基准,重点考察模型在混乱生物数据中选择分析路径、处理不确定性并作出研究判断的能力,用于衡量更接近真实科研流程的AI进展。