在9月14日上海开幕的第十届GOPS全球运维大会上,华为云作为AIOps标准工作的成员单位出席了授牌仪式,并接受了颁奖。AIOps 标准由中国信息通信研究院旗下云计算开源产业联盟(OSCAR联盟)、高效运维社区和 DevOps时代社区联合发起,汇聚了国内一线互联网企业、通信、金融等行业顶级单位及专家联合编写而成,是国内外首个AIOps 标准。此标准已在中国通信标准化协会(CCSA)正式立项,并正申请成为国际标准。华为云专家从AIOps标协立项之初就参与了AIOps企业标准的制定工作和AIOps产品标准的制定工作。
华为是AIOps实践的先行者
华为很早就在实践AIOps了,从最早的On-Premise运维,到之后的IaaS运维和近几年的PaaS运维,以及现今的面向SRE的平台运维和面向客户的应用运维,涉及智能分析、应用分析、智能诊断与调优、自治运维、智能运维等。
华为云主要聚焦在公有云建设,围绕数据中心在统一运维架构、运维研发化的基础上,重点发展运维的标准化、自动化和智能化。同时直接面向云租户量身打造出应用性能管理APM、应用运维管理AOM等云运维服务,提供了具备初步智能运维能力的立体运维。华为云AOM/APM服务研究实现了基于强化机器学习算法的Auto-Scaling;基于时序数据行为模式(比如平稳型、周期型、规律型等)分析的智能告警;采用网络包的Hierarchical Clustering分析方法推导出服务间调用的因果路径,准确率基本达到了90~95%以上;还有把改进聚类算法和创新的移位环算法对调用链数据进行“好”“坏”智能分析,结合函数出入参、环境信息、资源占用等变量,给出可能导致异常的原因,并在Dashboard中的拓扑图、heat map和histogram等形式呈现给用户。上述实践只是华为云利用ML技术探索AIOps核心能力建设的一部分成果。
AIOps深耕细作、聚沙成塔
AIOps首先适合用于复杂的场景中,尤其是各种可能组合数量远远超越了人力所能企及的范围;这种场景下人工分析缺乏对大局的完整认识,但AI能力很强。还比如复合因素下的趋势预测(资源寿命、性能指标、容量)、故障预防、问题定界定位、根因分析等。
其次AI技术在一些时效性要求高的场景中得到应用,比如基于指标、日志、事件的告警。应用或者系统出现异常后,是需要第一时间通知到运维值守人员的。还比如云服务的弹性伸缩、智能阈值告警。
尽管业界在某些子领域或者单点技术上AIOps取得了显著进展,但运维域AIOps还有很大的发展空间,离真正做到无人值守、NoOps还有很长的路要走,比如可信故障自愈、RCA传导、端侧智能等都有待业界共同努力。华为云成为AIOps标准工作的成员单位意味着华为云以开放的心态积极拥抱AIOps和参与社区建设,也体现了客户和社区对华为在智能运维领域的多年耕耘及成果的高度认可。在运维域,华为云提出做AIOps技术的引领者、行业AIOps运维转型的赋能者,以及云时代AIOps的铺路人,这与AIOps标准工作组的宗旨完全契合的,希望产业社区联合起来,共同促进和推动IT运维领域的智能化,为客户数字化业务保驾护航。
好文章,需要你的鼓励
美国连锁超市巨头Albertsons正在基于Databricks构建商品智能平台,整合产品、定价、促销与陈列等决策功能,目标是在2026年底前全面向门店运营商落地。该平台以Databricks Lakehouse存储零售数据,通过Unity Catalog与AI Gateway实现数据治理,并借助AI智能体Genie支持自然语言查询,帮助商家洞察销售趋势,提升决策效率。此举是Albertsons今年四项AI核心战略投资之一。
阿里Qwen团队通过引入强化学习和在线策略蒸馏,将Qwen-Image-2.0升级为Qwen-Image-2.0-RL,让图像生成模型真正学会人类审美,文生图Elo评分提升78分,图像编辑提升93分。
微软正将Windows 11打造成真正的AI操作系统。在Build大会上,微软展示了AI模型与智能代理如何深度融合进Windows 11,让用户通过自然语言完成系统操作。借助Windows ML框架,超过5亿台PC已可在本地离线运行AI任务,无需联网、无token费用、数据不离设备。Office、Photos、Teams等应用已支持本地AI能力,Adobe、WhatsApp、Canva等第三方也在积极跟进,企业级AI PC采购需求有望加速。
港科大与快手联合提出NormGuard,针对流匹配模型强化学习训练中速度范数膨胀问题,通过训练时单向惩罚约束,在保留奖励的同时改善图像真实感。