English
联系我们
网站地图
邮箱
旧版回顾



丁克

以“风”为令!杭州各部门严阵以待迎战台风“白海豚”_我的网站

疑犯追踪

一 |     如果你从去年就开始用 Gemini,那感觉就像看着自家兄弟慢慢得了阿尔茨海默症。    杭州日报讯 今年第13号台风“白海豚”来势汹汹,正向我省沿海逼近。         这是最近网友对 Gemini 的一句调侃。         按理说,一家公司发新模型,通常是来打脸这种调侃的。可就在刚刚,Google 一口气发了三个新模型之后,网友非但没收回这句话,反而笑得更大声了。多少有种他们都不看好你,可偏偏你最不争气的即视感。         三个模型分别是 3.6 Flash、3.5 Flash-Lite,还有一个专搞网络安全的 3.5 Flash Cyber。官方博客的措辞也相当眼熟,「更高效」「更聪明」「为大规模 AI agent 而生」,一句不落。         只不过,实际体感却冰火两重天。         主角登场,3.6 Flash 到底强在哪          先说头牌,3.6 Flash。官方给的定位就俩字——「主力」(workhorse),干活模型。

二 | 全市各部门以“风”为令、严阵以待,按照最高标准、最严要求落实落细各项防台举措,全力守护城市运行安全。

三 |          3.5 Flash 是今年 5 月 I/O 大会上发的,这次算是小版本迭代。杭州城管工作人员支撑加固路灯、树木。         最大的卖点是省 token。         按 Artificial Analysis Index 的数据,3.6 Flash 比 3.5 Flash 少用 17% 的输出 token,在 DeepSWE(Datacurve 出的基准)这类场景上甚至能省到 65%。官方还说它跑多步任务时,推理步数和工具调用都更少。杭州市综合行政执法局供图排水防涝
守住城市“生命线”针对30处历史易积水点、67座城市隧道及106座下穿通道,市综合行政执法局严格执行“一点一方案”,预置抢险力量与排涝设备,确保“雨来人在、水退人走”。钱塘江沿线九溪、进龙河、小天竺三大关键节点已完成驳坎加高、防倒灌处理,部署方舱3台、大功率排涝泵6台,24名应急队员现场待命。

四 | 自8月7日16时起,全市城市河道闸站全面停止引配水,实施预排预降腾出库容。截至8月8日中午,全系统已集结总排水能力达14.9万立方米/小时的排涝设备,备足沙袋3万余只、挡水板2100余块。

五 | 依托数字化平台,杭州城管搭建起内涝监测四大场景,接入3000余个动态感知站点与23万路视频资源,可实现内涝提前1小时以上预警。在台风来临前的“窗口期”内,已出动人员2014人次,整改隐患51处,清理雨水箅子1360处,确保隐患动态清零。防风除患织密头顶“安全网”为防范高空坠物,从8月7日晚开始,全市952顶非机动车道遮阳棚篷布连夜开始陆续撤除,并同步完成加固灯箱255套、拆除道旗1697杆。也就是说,干同样的活,废话更少,绕路更少,账单更薄。户外广告、店招店牌隐患排查中发现的40处问题全部整改完毕。         价格也确实降了。输入 1.5 美元/百万 token,输出 7.5 美元/百万 token——注意,上一代 3.5 Flash 的输出是 9 美元,这波直接砍到 7.5。又快又省,单个 agent 任务的成本就压下来了。         基准测试上,官方摆出了一整排数据。同时,35个在建城管工地也全部停工,并对新完工的24公里燃气立管进行防风加固。杭州城管提醒,台风影响期间,请市民尽量减少外出,避开低洼地带、广告牌及大树下方;及时加固或收回阳台花盆、空调外机等易坠物品;密切关注气象预警与社区通知,配合做好转移准备;若需出行,请务必绕行积水路段,远离电线杆等电力设施。支撑加固化解树木倒伏风险为全力防范“白海豚”带来的风雨影响,市园林文物局各部门及下属单位全员集结、严阵以待。         代码能力是重点。全市文保系统开展拉网式隐患排查,对重点点位逐项加固整治,排查化解树木倒伏风险,做到隐患即查即改、不留死角。全市启动全域排查整治专项行动,重点对古树名木、行道树、风口新植树木进行支撑加固,全面排查滨水绿地、高架绿化、绿化在建工地风险,加密核查城市公园、动物园、儿童公园等人员密集区域,确保各项防控措施落地落细。截至目前,全市园林绿化管理部门累计排查树木348868株次,其中古树名木893株次、各类绿地树木203046株次、行道树144929株次;累计支撑加固树木129334株,其中古树名木652株、各类绿地树木43892株、行道树84790株。DeepSWE 从 37% 提升到 49%,官方的说法是多余的代码改动更少、执行循环也更短,生成的代码更贴近生产环境的要求。发布预警防范流域洪水危害受“白海豚”风雨影响,杭州水文防汛形势趋紧,目前全市54个在建水利工程已全部停工。8月8日18时,市林业水利局联合市气象局发布山洪灾害风险预警:预计8月8日20时至8月9日20时,萧山区山洪灾害发生可能性大,为橙色预警;余杭区、富阳区、临安区山洪灾害发生可能性较大,为黄色预警;拱墅区、西湖区、桐庐县、建德市存在山洪发生风险,为蓝色预警。属地居民与往来游客需密切关注降雨和山洪预警信息,主动规避山洪风险。水文部门同步开展流域洪水研判,重点防范水库泄洪下游河道行洪风险。机器学习研究方向的 MLE Bench 提升更明显,从 49.7% 拉到了 63.9%。         计算机操作(computer use)能力也有长进,OSWorld-Verified 从 78.4% 升到 83%。

六 | 数据显示,自8月4日起,我市紧盯“小流域山洪”“山塘水库河网”两张核心风险清单开展前置排查整治,及时清理行洪沟道、桥涵盖板里的淤泥、枯枝杂草等堵塞物,力争在台风影响抵达前预降江河湖库水位、腾出调蓄库容,全力保障安全度汛。

七 | 百车集结支援温岭抢修工作8月8日清晨,天色阴沉,强台风“白海豚”的螺旋雨带已开始扫射浙东沿海。气象预报显示,这只“海豚”正加速逼近台州。温岭,这座被东海环抱的城市,即将迎来狂风暴雨的考验。清晨8时,国网杭州市富阳区供电公司的集结场上,由配网架空线路、带电作业等多个专业的骨干人员组成的支援队伍列队集合。并且,「计算机操作」(computer use)也成了Gemini API 和企业版的内置工具,主打一个开箱即用。         知识工作方面,GDPval-AA v2 从 1349 涨到 1421。随着引擎的轰鸣,工程车辆排成长龙,国网杭州供电公司第一批支援队伍直奔300公里外的东南沿海——温岭市松门镇,台风“白海豚”影响的核心区域。按照“一市帮一县”的部署,这是今年继7月台风“巴威”之后,国网杭州供电公司第二次驰援台州温岭抗击台风。Hebbia、Harvey 等客户反馈,它在文档解析、图表数据分析、报告起草这类多模态任务上表现尤其突出。Figma、JetBrains 也都出面背书了一番。目前,国网杭州供电公司两批队伍已在温岭集结,共485名抢修人员、122辆抢修车。         哦对了,还有个不起眼但挺实在的更新:知识截止日期终于从 2025 年 1 月推进到了 2026 年 3 月。支援队伍抵达目的地后,第一时间便与属地供电部门进行对接——查线路走向、标危险点、记易涝区域,抢在台风尚未登陆前,将风险底数摸得一清二楚。在石塘镇,这个曾在台风“巴威”中影响最严重的地方,国网杭州供电公司支援温岭临平分队副队长沈国芳倍感责任重大。老黄历总算翻篇了。

八 | 他说:“上一次,我们在这里奋战了4天3夜,这次也一定要把这里守好!”当天下午,沈国芳便组织队伍加入了石塘供电所线路特巡工作,兵分3路,沿着海岸线逐一检查杆塔基础、拉线紧固情况,并用防水布包裹户外配电箱,对易被风刮起的漂浮物进行清理。         安全这块,官方说 3.6 Flash 上了升级版的 Frontier Safety 防护,重点盯着 CBRN(化学、生物、放射性、核)和网络攻击这两类滥用,抗越狱能力更强了,同时又尽量不误伤正常需求、少乱拒绝。

九 |          ·以小博大,便宜大碗的 3.5 Flash-Lite 也能更换推理档位了          第二个是 3.5 Flash-Lite,定位比 3.6 Flash 还低一档,主打「快」和「便宜」,专治高吞吐、低延迟的任务,比如 agent 搜索、文档处理。

十 |          它是 3.5 系列里最快的,按 Artificial Analysis 的测量是每秒吐 350 个 token。台风未至,风雨已来。

十一 | 但在这座海滨之城的每一条线路旁、每一个变电站里,都有来自杭州的“电网铁军”与当地保电队伍并肩作战,守护万家光明。价格更是白菜——输入 0.3 美元、输出 2.5 美元每百万 token。官方说质量比 3 月发的 3.1 Flash-Lite 好一大截。         有个设计挺灵活:它支持调「推理档位」。低配活儿就开最低档,图个快和省;碰上要多步拆解的子任务,就把思考档位往上拨。电脑操作这次也做成了内置工具。         跟前代比,提升相当明显:代码和 agent 任务的 Terminal-Bench 2.1,从 31% 干到 54%;长上下文的 GDM-MRCR v2,从 60.1% 提到 72.2%;真实任务执行的 GDPval-AA v2,更是从 642 飙到 1140。         最有意思的是,这个「小弟」在不少 agent 和代码任务上,居然反超了辈分更高的 3 Flash。

十二 |          比如 SWE-Bench Pro(54.2% vs 49.6%)、OSWorld-Verified(74.0% vs 65.1%)。以小博大,属实有点东西——等于说跑 3 Flash 的活儿,现在有了个更快更强的平替。         官方还举了几个用法:从海量电商数据里抽产品特征、给 3.6 Flash 当副手一口气生成 25 个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏。Ashler、Palo Alto Networks、Ramp 这几家客户也来夸了它「速度、智能、成本三合一」。         最后一个 3.5 Flash Cyber,画风突变,专门用来找和修代码里的安全漏洞。

十三 |          Google 的逻辑挺有意思:现在 AI 找漏洞的速度,已经比现有系统修漏洞的速度快了。既然漏洞越堆越多,那干脆用便宜高效的 Flash 来批量补锅。

十四 |          这个模型是在 3.5 Flash 基础上微调出来的,搭配自家的 CodeMender 工具用。CodeMender 里跑的是好几个 Flash Cyber agent,协同工作、最后汇总成一份报告。         在业内有名的 CyberGym 基准上,官方称它摸到了第一梯队的水平,还比更大的模型更省 token。         不过这模型我们暂时也用不上。         考虑到「找漏洞」这种能力是把双刃剑,浓眉大眼的 Google 也学 Anthropic 玩起了安全叙事。把它锁得死死的——只对「可信合作伙伴」限量开放,走内测。目的是给一线防守方争取时间,赶在漏洞被人利用前先修掉,同时防着有人拿它去干坏事。         说好的 3.5 Pro 呢?如来          看到这儿你可能会问:发了一堆 Flash,那真正的旗舰 3.5 Pro 去哪了?          官方口径是「正在和合作伙伴测试,准备好就上」。但这套说辞背后的故事,可能没那么体面。         据彭博社等媒体报道,3.5 Pro 的代码生成能力一直没达到内部预期。Google 6 月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色。更有传闻说,Google 干脆推翻了原来的训练方案,从零开始重训。         而 Google AI 宣传委员 Logan Kilpatrick 更是索性在舆论上直接跳过 3.5 Pro,将预告的重点放在了Gemini 4,声称他们已经启动了史上最雄心勃勃的 Gemini 4 预训练,还放话说进展让人兴奋。         听着虽然挺提振人心,但把它放在「旗舰跳票」的背景下看,多少有点转移视线、画饼续命的味道了。         除了这些内幕,光看今天刚刚发布的 Flash 模型本身,网友们也并不全然买账。         第三方评测机构 Artificial Analysis 表示:两个新模型确实把单任务耗时砍半、token 效率也提升了,Flash-Lite 的智能指数涨了 11 分——但 3.6 Flash 的智能水平,相比 3.5 Flash 基本原地踏步。         价格没有便宜到足以忽略能力差距,能力也没有高到能够解释它的成本。

十五 |          X 网友吐槽道:3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿了一模一样的分,还不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 这一票对手,直呼简直烂透了(阴阳怪气 doge)。         吐槽的还不止一个。         网友 Angel 则直接从性价比入手:Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 还高,可智能程度反而更低。又贵又笨,这组合属实有点尴尬——毕竟 Flash 系列立身的根本就是「性价比」,结果被人当场指出性价比不如对手,等于自砸招牌。         作为对比,OpenAI 的 Tibo 刚刚也发话了:由于周活跃用户达到 1000 万,新的一天,Codex 和 ChatGPT Work 的付费用户迎来新一轮额度重置,尽情享用。         这对比,这落差,还有人记得大明湖畔的 Google Gemini 3?          实测派也来补刀。

十六 | 网友 Balder 更是直接开团:          这三个模型性能全比之前的 3.5 Flash 差。他甩出自己的测试吐槽,说问题包括但不限于——基础解码就有毛病、中文选词经常很离谱;生成的图片视频质量极差、跟指令对不上还限额严重;经常记忆混乱、调用完全错误的工具。         而且他还上了个阴谋论,认为 Google 之所以这么搞,是为了把算力腾出来卖给 Anthropic,还阴阳了一句这就是皮查伊想要的「Cloud First」。

十七 |          此外,X 网友 Conor Dart 用 Google 自家的 Antigravity 跑了个 AI 生成游戏的测试,结果没有出乎意料,木头纹理更差了,大理石看着差不多但还是不能用。他直言这又是一次翻车,表示自己还是等 Gemini 3.5/3.6 Pro 吧。         简言之,你别问新模型强不强,你就说 Flash 不 Flash 就完事了。一边是官方更高效、更便宜、更省 token的漂亮账本,一边是大多数网友的当场差评,以及模型背后的旗舰跳票、大牛出走、市值缩水等一连串糟心事。

十八 |          这很难不让人好奇是不是 Google 这次真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个 Flash 稳住场子?          反正 Gemini 4 的预训练都开跑了。这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。

Current article:http://4z0.cuancuguanzhongnieqinyazhun.cyou/news/20260826_58661.html

Published on:00:21:01


专题推荐

相关新闻


© 1996 - 我的网站 版权所有   联系我们

地址:北京市三里河路52号 邮编:100864