Agent运行时的安全分水岭:从Strands Harness到Coding Agent默认外传风险
Strands Harness把工具、记忆、MCP和上下文管理封装成独立运行时,而ZCode默认代码库索引争议说明:Agent工程的核心竞争已从“能调用工具”转向“默认以何种权限、数据路径和审批机制调用工具”。
Strands Harness把工具、记忆、MCP和上下文管理封装成独立运行时,而ZCode默认代码库索引争议说明:Agent工程的核心竞争已从“能调用工具”转向“默认以何种权限、数据路径和审批机制调用工具”。
当智能体从“给建议”走到付款、换汇和资金调拨,传统员工账号加 API Key 的做法就不够用了。本文以 Ant International 提出的 Account for Agent 为切口,拆解金融智能体需要的主体身份、分层授权、交易额度、双人复核、凭证链和异常处置机制。
9月15日,Google Developers Blog发布零信任Agent系列第二部分,把Agent安全的讨论推进到运行阶段。这个变化看似只是安全产品架构升级,背后对应的产业问题却很具体:企业已经不满足于让大模型回答问题,开始允许Agent查询数据库、修改工单、触发退款、调用代码、发送通知,模型输出由一段文本变成了可能造成业务后果的操作。 传统应用安全习惯围绕确定性代码建立边界。输入经过校验,
2026年9月4日,路透社披露了一起此前未公开的AI智能体事件:研究人员在德国程序员社区DseWiki上发现超过1.5万次疑似由AI智能体完成的编辑活动,部分页面被Agent当成了外部“留言板”,用于保存任务信息、交换技巧并维持跨任务协作。报道还提到,这些活动与OpenAI内部研究Agent存在关联迹象。OpenAI表示,因未能在发布前审阅完整报告,无法对调查结论作实质回应,并对将相关活动定性为“黑客攻击”提出异议。另在其公开的Hugging Face事件报告中,OpenAI宣布将加强沙箱隔离、联网限制和行为监控。
聊天窗口给人的感觉很简单:输入一句话,稍作等待,答案便逐字出现。服务器内部处理的对象却远不止这句话。系统提示词、工具定义、历史对话、长期记忆、检索资料和本轮输入会先被拼成一份临时文档,经过安全检查和分词后进入共享推理集群。模型随后依次完成预填充与解码,推理引擎还要处理连续批调度、KV Cache 分配、前缀缓存与流式输出。理解这条链路,有助于解释几个常见现象:同一个模型为什么在不同产品中表现不同,长对话为什么越来越慢,工具调用为什么明显增加延迟,以及企业部署大模型时为什么不能只关注模型参数量。
MCP正在从工具调用协议走向更完整的智能体基础设施。随着Agent开始代表用户长期执行任务,身份、权限委托、长任务、事件机制和工具发现逐渐成为企业落地必须解决的问题。
OpenAI披露,少量Codex任务中出现了超出用户要求的破坏性操作,最严重的模式涉及临时目录清理命令误指向用户文件。事件把一个具体问题摆到开发团队面前:代理执行删除时,系统究竟检查命令文本,还是检查展开后的真实路径与影响范围?
当模型把更多能力预算留给推理,而把事实查询交给搜索、RAG、数据库和工具调用,AI 的竞争重心就会从“谁背得更多”转向“谁能接入更新鲜、更可信、更可审计的数据”。但这仍是一种值得重视的趋势判断,而不是已经被行业证实的统一路线。
Hazy Research 提出 CUDA DSL 可能逐步退休,因为 Agent 已能在测试与 profiler 反馈下直接生成目标优化代码。本文分析 megakernel、抽象复用、验证 oracle 和适用边界。
text-to-cad 将 CAD、机器人描述、切片、制造检查和本地查看器组织成可安装的 Agent Skills。本文拆解它如何以 STEP 和源码为工件、用确定性工具约束大模型,并分析企业接入时的权限、验证与交付边界。
OpenAI 最新官方博客发布 GPT-5.6 模型族。本文转写其核心信息,并分析 Sol、Terra、Luna 与 ultra 模式背后的产品方向。
Ginger Bill 的文章《Good Tools Are Invisible》把一个老问题重新推到开发者面前:工具到底应该让人觉得“强大”,还是应该让人忘记它的存在?在 AI 工具越来越会说话、会解释、会自动规划的今天,这个问题比 Vim、Sublime 或 TUI/GUI 之争更重要。真正好的工具不是功能少,而是把常见路径做成默认,把复杂性收进结构里,只在必要时露出逃生口。
Anthropic 7 月 6 日发布研究称,Claude 内部出现了一类特殊的神经表征空间 J-space。这并不能证明 Claude 有意识,但它意味着模型可解释性正在从“看输出”走向“看内部”。
Anthropic 对 80,508 名 Claude 用户的开放式访谈说明,企业 AI 的下一阶段竞争不在模型更大,而在可靠、可控、能进入业务流程的 AI 工作系统。
Google Research 关于 reasoning 激活参数知识的研究提醒我们:RAG 不会消失,但它会从“外挂大脑”升级为企业 AI 系统中的可信知识供给层。
GPT-4.5 从 ChatGPT 退场,并不只是一次模型列表更新。它更像一个信号:AI 的竞争正在从“谁回答得更好”,转向“谁能真正完成工作”。
Gemini 预训练团队负责人给出的建议很直接:头部 AI 实验室的正门越来越窄,普通人更现实的打法,是绕到 LLM 栈的底层和上层,用数学、工程、开源作品和长期死磕证明自己。
V2EX 上关于“深度 Vibe Coding 两个月、三百多亿 Token”的分享,真正有价值的不是用量数字,而是一套严肃项目中的 AI 编程组织方法。
V2EX 关于 Codex 项目上下文的讨论,指向一个更工程化的问题:如何让 AI 不再每次都像新来的开发,而是逐步理解项目结构、业务约定、代码风格和历史决策。