翻页 夜间
首页 > 火柴人 > 夜线

超凡蜘蛛侠

让不同智能体一起干活,难在哪?_我的网站

霍去病

A |     编者按 工业和信息化部、中央网信办等部门近日联合印发的《关于推动互联网基础资源高质量发展的指导意见》提出,到2035年,我国成为全球互联网基础领域重要创新策源地和引领者。针对当前国内互联网基础资源高质量发展面临的挑战,本报聚焦智能体互联网络基础设施建设、韧性域名系统体系化构建这两大关键议题,深入剖析行业痛点,探寻破局路径。    家人们,就在刚刚,Google正式发布了Gemini 3.6 系列模型!          这次登场的一共三个模型:          面向普通用户和开发者推出的通用模型 Gemini 3.6 Flash:               输出 token 消耗减少了约 17%,在 DeepSWE 上最高减少 65%          输入:1.50 美元/百万 token          输出:7.50 美元/百万 token               主打低成本和高吞吐的 Gemini 3.5 Flash-Lite:               输入 $0.30/百万 token          输出 $2.50/百万 token               面向网络安全场景的 Gemini 3.5 Flash Cyber:      定价还没曝光,目前只给政府和还有Google定的受信任的合作伙伴限量开放               在正式开始详细介绍前,先给大家打一针预防针:          如果只看跑分,这次更新可能没有想象中那么炸裂—Gemini 3.6 Flash 的综合智能水平与上一代基本持平,代码能力也没有横扫同级模型,但是效率绝了!          Gemini 3.6 Flash          Gemini 3.6 Flash 是 Gemini 3.5 Flash 的升级版,也是这次发布的主角。

B |          根据 Artificial Analysis 的发布前测试,Gemini 3.6 Flash 在 Intelligence Index 上拿到了50 分,与 Gemini 3.5 Flash 持平(Ps:从综合智能表现来看,可以说完全没有实现代际跃升):          在Gemini最擅长的知识类工作的基准GDPval-AA v2 上取得 1421 Elo,比上一代高 72 分:          它真正值得一说的提升,在速度和效率上。

C |                           “帮我看一下手机日历中的出差计划,根据行程订好机票、出租车,再安排一下用餐。”执行用户发送给AI助手的这样一句指令,离不开多个跨平台智能体的协同合作。         Gemini 3.6 Flash 完成单项任务的平均时间从 2.7 分钟降至 1.3 分钟,缩短了一半以上;输出速度达到 每秒 304 个 token。当前,智能体互联互通水平快速提升,正推动智能体技术从单点应用向网络化协同发展跃升。

D |            不久前印发的《关于推动互联网基础资源高质量发展的指导意见》提出,探索构建具备统一通信协议、数据交互标准和接口规范的智能体互联网络基础设施。与此同时,它的输出 token 消耗减少约 17%,在 DeepSWE 等特定任务上,降幅最高可达 65%。作为AI时代最具变革性的技术形态之一,智能体的互信、互联、互操作水平正深刻影响着AI技术的落地效果与产业价值释放。

E |          虽然没有更聪明,但是确实做到了能用更少的 token、更短的时间完成同样水平的工作。           然而,构建智能体互联网络仍面临多重现实障碍。         Gemini 3.5 Flash-Lite          Gemini 3.5 Flash-Lite 面向的是另一类需求:高并发、低延迟和大批量任务。         它在 Intelligence Index 上取得 36 分,相比 Gemini 3.1 Flash-Lite 的 25 分提升了 11 分。让不同智能体一起干活,究竟难在哪儿?            互联要闯“五道关”            “单体智能解决的是‘一个智能体会不会做事’,智能体互联网解决的是‘不同智能体能不能一起把事做成’。”中国信息通信研究院(以下简称“中国信通院”)工业互联网与物联网研究所互联网研究部主任李炳奇告诉记者,当前,AI正从回答问题、生成内容,进一步走向理解目标、调用工具和执行任务。但单个智能体再强,也会受到知识、数据、工具和权限边界的限制,智能体数量的增加,并不会自然形成群体智能。

F |          进步最明显的是智能体相关评测:GDPval-AA v2 提高 498 分,TerminalBench v2.1 提高 22.5 个百分点,Tau3-Banking 提高 7.8 个百分点。

G | 面向企业经营、产业链协同、城市治理等复杂任务,需要不同平台、不同组织的专业智能体能够相互发现、确认身份、调用能力并协同执行。           要实现这一目标,首先要解决智能体之间“找不到、认不准、连不通、协同难、责任不清”的问题,从而构建开放、可信、可治理的网络基础设施。

H | “智能体互联网就是让分散的智能能力能够按需组合,推动AI从单点应用迈向网络化协同。

I |          速度同样是它的核心卖点,平均每任务用时从 1 分钟降至 0.6 分钟,输出速度达到 每秒 350 个 token。”李炳奇说。           前景虽广,但智能体互联网建设并不是简单地把现有接口再封装一遍,而是要建立一套面向自主智能主体的网络机制。         不过,Gemini 3.5 Flash-Lite 的单次任务成本不降反升,从 0.04 美元增至 0.09 美元。           李炳奇认为,在技术方面,智能体互联网发展壮大至少要闯“五道关”。         主要原因是输入和输出价格分别从每百万 token 0.25 美元和 1.50 美元,上调至 0.30 美元和 2.50 美元。第一是“身份关”,要解决智能体是谁、属于谁、具有什么权限等问题,为每个智能体建立唯一标识、可信认证和动态授权机制。第二是“发现关”,要用机器可理解的方式描述智能体的能力、输入输出和服务条件,让智能体能够根据任务找到合适的合作对象。尽管平均每任务的输出量已从 2 万 token 降至 1.3 万 token,但仍不足以抵消价格上涨带来的成本增加。         Gemini 3.5 Flash Cyber          除了两款通用模型,Google 这次还公布了一个更垂直的成员:Gemini 3.5 Flash Cyber。第三是“互通关”,要解决不同模型、框架和平台之间协议及语义不一致的问题,统一任务表达、状态管理和上下文传递。         CodeMender 是 Google 的代码安全代理,主要任务就是是在代码中发现安全漏洞,并进一步生成和验证修复方案。这次出的Gemini 3.5 Flash Cyber 将作为CodeMender的核心模型,服务于漏洞查找与修复流程。第四是“协同关”,要支持任务拆解、能力编排、过程反馈、异常处理和服务质量保障。         按照 Google 的说法,它在代码安全任务上的表现达到了非常具有竞争力的前沿水平,并且运行成本也低于体量更大的模型。第五是“安全关”,要把最小权限、加密传输、运行隔离、行为审计、风险监测和责任追溯嵌入全过程,最终实现能力可发现、身份可认证、任务可协同、行为可管控、责任可追溯,并且在海量智能体接入的情况下仍然可靠、稳定、可扩展。           目前,中国信通院正联合产业各方,围绕总体架构、身份标识、能力发现、互联协议和安全治理等开展研究,推进标准研制、试验验证和国际交流。

J |          Gemini 3.5 Flash Cyber 更像是 Google 对“专业模型+智能体”路线的一次验证: 以更轻量的 Flash 为底座,通过安全领域优化和专用代理,把模型能力集中到一个明确的高价值任务上。其中,中国信通院子公司北京泰尔英福科技有限公司正围绕身份、注册、发现、互联、安全五大环节,积极参与各类产品设计与技术验证工作,在分布式数字身份、智能体标识注册、能力发现匹配、跨域可信互联和分层安全治理等方面打通关键链路,推动不同平台智能体实现互认互通。           技术标准有待统一            尽管当下绝大多数智能体均具备调用外部工具、对接业务系统的接口能力,但实现跨厂商、跨领域、跨技术栈的智能体互联,仍面临多重瓶颈。           就底层技术标准而言,当前行业内A2A、MCP、ANP、AIP等多种交互协议并行探索,异构智能体底层技术栈、语义表达体系各不相同,缺乏有全行业共识的统一通信规范与语义对齐机制。大量智能体处于“各自为战”的孤岛状态,即便能连上外部系统,也难以与其他生态的智能体开展稳定、高效的自主协作,跨生态适配成本居高不下。           李炳奇说,目前,智能体互联仍处在标准形成期,企业协议、开源项目和国际标准同时存在。         安全代理往往需要持续扫描大型代码库、分析大量上下文,并反复验证修复结果。相比一味调用最强、最大的通用模型,针对网络安全任务优化的轻量模型,更有可能在能力、响应速度和运行成本之间取得平衡。例如,从产业侧看,MCP主要解决智能体与数据、工具和外部系统的连接,A2A主要解决智能体之间的发现、通信和任务协作,两者具有较强互补性。A2A已由Linux基金会托管并发布1.0稳定版本,MCP也已纳入Linux基金会旗下的Agentic AI Foundation,这说明相关协议正在从企业主导的技术方案,逐步走向开放、社区化和相对中立的治理模式。           从国际标准组织看,互联网工程任务组(IETF)已围绕智能体发现与调用、身份管理、任务协同和跨域互操作等形成一批互联网草案;全球移动通信标准制定国际组织第三代合作伙伴计划(3GPP)也开始从6G体系角度研究智能体的注册、发现、鉴权和通信。但值得注意的是,相关互联网草案仍属于“工作中的提案”,尚不等同于正式国际标准。不过,Gemini 3.5 Flash Cyber 暂时不会向所有开发者开放。           “总体来看,当前技术路线和协议仍较为分散,跨平台互操作所需要的身份、发现、寻址和信任等公共层能力还不完善。”李炳奇说,此外,智能体具有较强的自主性,对错误调用、权限越界、数据泄露和责任认定等问题,需要建立不同于传统软件的新型治理机制。同时,测试评估、服务质量、成本结算和生态运营模式也尚未成熟。它将通过 CodeMender 独家提供,仅面向受信任的合作伙伴开展有限访问试点。

K |          单看代码表现          在 Arena 公布的前端代码竞技场排名中,Gemini 3.6 Flash 以 1537 分位列第 12 名,相比 Gemini 3.5 Flash 的第 21 名有明显进步。         结语          目前,Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正在 Gemini App 中陆续上线,开发者也可以通过 Google AI Studio 和 Android Studio 的 API 使用新模型。

L |          至于正在内测的 Gemini 3.5 Pro,以及已经开始训练的 Gemini 4,或许才是 Google 留给下一次能力跃升的真正看点。

M |            落地场景仍需沉淀            找到应用场景是推动智能体互联网进一步壮大的关键。         最后,关于 Google 这次发布,我还有几句话想说          过去的大模型发布,最容易传播的是跑分又涨了多少,但是这几次跟Google家感觉已经不恋战了。当前,对于智能体互联网的场景挖掘尚显不足,需要多智能体相互协作,尤其是跨平台协作的刚需场景较少。大多数场景仍停留在单体智能体或企业内部编排层面,真正跨组织协同、能够形成明确投入产出比的场景还不够多。           “智能体互联网的发展需要兼顾技术攻关和场景落地两方面。”北京泰尔英福科技有限公司智能体创新部副总监胡嘉明认为,智能体作为自主性更强、风险更高的新型网络交互载体,应当有身份安全、互联安全的制度保障。它已经不太愿意继续纠缠于单纯的跑分竞争了。同时,要充分发挥我国丰富的应用场景潜力,加速探索智能体互联网赋能产业的新场景、新服务、新模式,通过场景验证和市场筛选,让可复制、可持续的智能体互联网应用场景逐步沉淀。         Gemini 3.6 Flash 交出的依然还是近两年非常具有Google味儿的答卷:          综合智能分数可以不变,只要任务速度翻倍、token 用量减少、输出价格下降,模型依然能够获得非常实际的竞争力。         可能有人会问:是不是 Google 已经卷不动了?          但在我看来,这更像是大模型竞争进入下半场的一个信号。         当头部模型之间的能力差距逐渐缩小时,开发者真正关心的问题会越来越具体:同一个任务需要等多久?一次调用要花多少钱?长上下文是否稳定?能不能支撑大规模并发?          从这个角度看,Gemini 3.6 Flash 是 Google 又一次明确面向落地效率的升级。           胡嘉明介绍,以智能体互联网示范网络为工作基础,北京泰尔英福科技有限公司研发了可支持多智能体协作的智能体工厂、智能体公共服务平台、供应链协同平台和产业供需对接平台,在智能体编排调度、政务民生服务接入、上下游跨组织协同和企业供需智能匹配等场景开展试点验证、产业服务。

N |            “既不能等到所有标准完全成熟后再行动,也不能在标准缺位的情况下盲目铺开。”李炳奇建议,应坚持“标准先行、场景牵引、试验验证、治理同步、开放合作”理念,先建设试验网络,构建身份、发现、互联等公共能力,再选择制造、商贸、政务等高价值场景开展小切口、深流程验证;同时完善检测认证、审计溯源和风险处置机制,积极参与国际标准和开源生态建设,逐步形成开放互联、可信可控、可持续运营的智能体互联网产业生态。           (科技日报 本报记者 都 芃) 【编辑:刘欢】。

o |

Current article:http://v1hep4f.ruandaimingyunsun.sbs/news/20260826_715.html

Published on:19:54:18