分类: AI技术

0

EmbeddingGemma 2把检索放进手机,企业先别急着叫它端侧智能

应用场景示意,设备型号与铭牌为视觉示例,不代表报道中的真实设备;非产品界面截图。 图注:应用场景示意;画面中的设备型号、序列号和铭牌参数均为视觉示例,不是新闻事实或产品测试数据。 Google DeepMind 10月6日发布EmbeddingGemma 2:7.4亿参数,采用Apache 2.0许可,目标是把文本、代码、图像、视频帧和音频映射到统一向量空间。Google Developers

0

Mistral Large 4的万亿参数,企业先算每个成功任务的成本

配图为概念示意,不是现场实拍或产品界面截图。 Mistral在10月6日开放Mistral Large 4公共预览。按公司发布的说明,这是一款原生多模态混合专家模型,总参数约1万亿,每次推理激活约490亿参数,同时面向指令执行、推理和Agent任务。现在能用的是API;权重计划月底开放。最容易在采购会上被放大的数字是“1万亿”,最需要追问的却是:谁能把它稳定地用在企业自己的材料和流程上,且算得清

0

North 2给企业Agent装上控制台,预算与权限还得逐项验

一家企业想让Agent读客户邮件,把附件里的要求写进Jira,再去SharePoint核对合同,草拟答复。演示很快。可真到上线那天,安全同事只要问一句“它凭谁的账号读合同”,会议就得停下来。Cohere在10月5日推出North 2,把Agent、自动化、可复用Skills、跨会话Memory和知识Libraries放进同一个工作空间,也给管理员配置权限和消耗的地方。我对这个方向有兴趣,但“有控

0

Beam的5010亿参数,企业该怎么算这笔账

Reflection AI在10月5日公布Beam,参数表够醒目:总量5010亿,单个Token约激活230亿;预训练用了23.8万亿Token,后续强化学习在1.05万张NVIDIA GB300上跑了四周,产生超过1亿条Rollout。看到这张表,我先找下载地址。还没有。厂商目前开放的是早期访问报名,称模型仍在最终红队与评估阶段,权重、技术报告和模型卡计划本月晚些时候交付。现在可以研究它的技术

0

Agent隐私风险不能只靠一次授权:读MLCommons的25类风险

员工同意Agent“帮我整理会议”,随后它读了旧邮件,又把发言人姓名发给外部转录工具。员工原本只是想整理今天的纪要。子Agent再接手排期时,谁来决定纪要能否继续转交?人往往在第一步点了允许,数据却在后来几步才真正离开原有边界。MLCommons AI Risk & Reliability项目发布的《Agent Privacy Risk Taxonomy v0.1》把这一类难题纳入25类

0

Agent说完成了,数据库同意吗?ThinkingBox的企业工作流验收方法

Agent说“处理完成”。值班同事打开后台:工单状态没变,客户资料反而多改了一列。演示里的对话很顺,业务结果却错了。微软Copilot Studio团队与Hugging Face发布的ThinkingBox,正是为了让这种差别进入评测表:把Agent放进带有初始后台状态、策略约束和工具的沙箱,执行完毕后对照数据库的黄金状态检查,而不以最后一句回答作为通过条件。公开资料介绍了507个合成企业工作流

0

Armadin拿到2.555亿美元:持续红队的难题,是让攻击模拟停在正确的位置

企业做一次渗透测试,拿到报告,排期修复。下次测试可能在数月以后。其间账号权限会变,云服务会增加,旧配置也可能重新出现。Armadin要解决的正是这种间隔:用自主Agent持续模拟攻击者,把零散弱点串成可能走通的攻击路径。10月1日公布的2.555亿美元B轮融资,让这个方向受到关注;但比融资额更值得企业琢磨的是:如果红队

0

Strands Decider 2B:Agent的每一步,都值得请大模型来决定吗?

一个Agent在回答用户之前,常常已经做了几次选择:这句话要不要检索?交给哪个模型?能不能调用某个工具?是否需要转给人?这些判断通常只有几个候选答案,却可能每次都让通用大模型跑一遍。Strands Agents开源的Strands Decider 2B,正是冲着这类重复判断来的。它给候选项打分,而不是写一段漂亮的解释。

0

Agent网关放在调用现场:Tuskira开源方案给企业出了什么题

10月1日,Tuskira发布开源、自托管的AI Agent Gateway。按照当天《AI技术每日分析》第三节的介绍,它位于Agent与大模型、MCP服务器和工具之间,统一处理模型路由、工具权限、调用日志、Token用量、成本追踪与策略执行。项目宣称支持Claude Code、Cursor、Codex、Claude

0

Gemini 4 Argon 的长任务能力,企业该怎样验收

Google 发布 Gemini 4 Argon,把真实软件工程、法律与金融知识工作、网络安全防御列为目标场景。它先向 Fairwind Program 中受信任的网络防御者开放,同时参与美国政府自愿性的模型预发布访问流程;开发者、企业和消费者的开放范围要根据早期测试逐步扩大。这些信息来自今日《AI技术每日分析》第一节

0

OpenAI dots 把 Agent 留在后台:企业需要重新画权限边界

每天早上替你看一眼项目进度,发现异常先调查,能准备的工作提前准备,需要签字时才叫你回来。OpenAI 的 dots 想把这样的 Agent 变成持续运行的软件主体。麻烦也随之变得具体:它昨天获准读过的信息、今天收到的恶意指令、明天要发出的邮件,谁来分清?

0

Agent 写完代码以后,谁来验?SonarQube Server 2026.5 的自管答卷

让 Coding Agent 在内网写代码并不难,难的是它写完之后由谁独立查错、谁有权放行、证据能否留在企业可控的环境。SonarQube Server 2026.5 LTA 把 Vortex、Hunter 和 Remediation Agent 带到自管部署,但“本地部署”等于“完全离线”的说法还得对照许可与模型出口逐项核查。

0

不把声音先压成文字:Modulate 的音频原生模型想听见什么

客服录音里,用户说“没问题,我再等等”,文字看着很客气;但若这句话前面沉默了十秒,语速突然放慢,另一端的语音助手还在重复同一句答复,质检人员大概不会把它判作一次顺利沟通。把通话先转写,再让语言模型读文本,能处理“说了什么”,却未必保留停顿、

0

Agent下班后继续干活:Microsoft与Docker把运行治理推到台前

员工关掉电脑后,Agent还在追踪项目、读取邮件、调用工具,甚至准备处理下一条任务。这样一名“数字同事”需要什么?Microsoft的Autopilot给出产品层面的答案:长期目标、独立身份、记忆、计算环境和工作区。Docker同期推出Cloud Sandboxes与Kits,给出执行层面的答案:隔离运行、跨设备迁移,并把工具、网络和凭据边界随Agent一起封装。两家公司进入路径不同,却共同指出

0

当AI开始研发下一代AI:Anthropic的26%意味着什么

一个实验室用自己的模型协助研发下一代模型,究竟快到了什么程度?过去,这个问题常被演示视频、论文数量和员工感受代替。Anthropic在9月25日公布的一组内部指标,把讨论推进到任务层:截至2026年8月,其被测模型研发工作中,26%达到AL4“AI主导”,超过90%达到AL3“AI协作”及以上。更惊人的对照是,2月时“AI主导”占比还不到1%。 这组数据值得认真看,也最容易被误读。26%不是“2