来自该信源的全部动态 · 共 229 条
Anthropic近期将Claude Code自动模式设为默认,并宣称其能有效防御提示注入攻击。研究人员Johann Rehberger发现一种可利用的攻击方式,通过诱导编码代理下载并解压恶意压缩包,绕过自动模式的安全防护,声称攻击成功率约为80%,暴露出智能编码代理在处理不可信内容时的风险。
Paul Dix认为,AI生成约100万行代码并在数月内迭代成可靠软件,已运行在数百万开发者机器上。即便有原系统作对照,这仍显示只要建立验证系统并给出明确方向,AI可承担大型代码迁移与工程实现。
llm-anthropic 发布 0.27 版,主要为适配新发布的 anthropic Python SDK 1.0.0。新版 SDK 从 httpx 切换到 httpx2,作者借助 Claude Code 按迁移指南完成升级并修复测试。
Farid Zakaria介绍一种Linux技巧:将SQLite数据库文件直接设计为可执行二进制。做法是把文件偏移68字节处的应用标识设为SELF,并将ELF格式的各组成部分映射到SQLite表中,再通过自执行解释器完成加载。这展示了数据库结构与操作系统可执行格式结合的可能性。
《金融时报》称,Anthropic 7月年化收入升至650亿美元,较5月的470亿美元继续增长,并预计按同一口径三季度有望盈利,但其最强模型仍面临用户增长压力,6,000名年付费超10万美元客户的集中度也折射出商业化结构。
Drew Breunig 指出,过去总能指望新模型用更低成本掩盖代码与上下文策略问题,但 Fable 之后这种「免费午餐」正在消失。随着高端模型价格和能力差异并存,团队开始更认真地分配工作、优化 harness 与上下文管理。
Linus Torvalds 在一次调试经历中提到,AI 虽多次判断问题无解并建议放弃,但在他持续推动下,仍能稳定生成调试代码、分析结果并协助缩小故障范围。文章强调了 AI 在复杂排障中的耐心与局限。
Simon Willison指出,高效使用编码智能体的关键,不只是让它完成代码修改,更要能准确描述目标并可靠验证结果。逐行检查并非唯一方案,还可结合测试、行为验证、差异审查和其他工程手段,确认改动符合预期且没有引入问题。
Simon Willison 发布 llm 0.32.1,修复因 OpenAI Python 库不再依赖 httpx、导致 LLM 通过传递依赖获取该库而使全新安装失败的问题。该版本暂时将 openai 固定为低于 3,预计即将发布的 0.33 版本会把依赖从 httpx 切换至 httpx2。
llm-openrouter 0.7 已更新至兼容 LLM 0.32,并改用 OpenRouter 的 Responses API,因此通过 OpenRouter 调用推理模型时表现更稳定。该版本新增 Shell、WebFetch 和 WebSearch 三种服务端工具,可通过 -T WebSearch 等参数启用,扩展模型执行命令、抓取网页和搜索信息的能力。
Thomas Ptacek 认为,即使是个人小工具,也应优先做真正的原生图形界面。随着编码代理降低实现成本,简单可用的 GUI 已不再难做,作者也因此反思自己常用的 macOS 菜单栏监控应用。
Matt Webb 说,自己在做应用时不再让 ChatGPT 直接写代码,而是把它当耐心的互动导师,借此学会了足够的四元数知识,最终把功能做出来。这个例子强调了 AI 不只是替代思考,也能反过来推动学习。
Simon Willison 指出,ChatGPT Search 似乎已在大规模查询中使用 site: 运算符来限定检索结果。文章还提到 Promptwatch 等 GEO 工具在追踪 ChatGPT、Claude、Gemini 的回答表现,反映生成式搜索优化正在成形。
Simon Willison 试验 Bun 1.4 新增 Bun.WebView,用其构建类似 shot-scraper 的 JSON API,可驱动网页渲染并提取结果。文章同时提到 Bun 1.4 的 Node.js 兼容性测试扩展和大量修复,重点偏开发者运行时与自动化能力。
Simon Willison 评估了 smolmachines 和 smolvm 作为运行不可信 Python、JavaScript 的快速沙箱,重点看 CPU、内存、无网络和受限文件访问等隔离能力,适合给需要执行用户代码的 AI 工具做参考。
Jeremy Morrell提出,LLM正在显著降低扩展开发成本,而现代沙箱原语也降低了部署与安全边界的门槛。他认为应用可保留稳定可信的核心,再让AI补齐缺口,把能力安全地扩展给用户。
Simon Willison 讨论了在代码智能体时代,为什么有时仍可以把代码行数当作生产力信号之一,但前提是要结合任务类型与概念完整性判断,不能把行数简单等同于质量或效率。
据Simon Willison援引Artificial Analysis数据,Qwen 3.8 27B在智能指数中获得52分,与GPT-5.6 Luna最高分持平,仅比GLM-5.2和DeepSeek V4 Pro 0813低1分。该模型参数规模远小于对比模型,结果显示其推理与综合能力可能具备较高的参数效率。
404 Media 追踪二手书商收到的大批量、匿名且不敏感价格订单,发现一批稀有书籍最终抵达亚马逊 AI 训练相关设施。报道强化了出版物被批量采购、扫描并用于模型训练的数据来源争议。
Simon Willison 更新了 markdown-svg-renderer,增强了在浏览器中直接渲染 Markdown 与嵌入 SVG 文档的能力,更适合分享包含图表、示意图和转录内容的文本。该工具定位轻量,强调把 Markdown 直接转成可浏览的展示页。