刚刚落幕的美加墨世界杯,不仅是一场全球体育盛宴,更成为AI技术大规模落地生产的标志性舞台。腾讯云撑起了全球17个国家和地区的官方赛事直播,覆盖亚太及国内三分之二的官方授权平台。腾讯云副总裁、国际产品技术负责人李郁韬在近期采访中透露,这届世界杯中,AI第一次大规模深入直播生产环节——画质增强、智能导播、自动剪辑、智能横转竖、质检溯源等绝大部分流程,已由AI全自动完成。一场世界杯的赛事支持,不过是AIGC开始迈入大规模生产应用的一个切面。
李郁韬将腾讯云在这一领域的定位,称为多模态领域的Harness(驾驭工程)。他强调,腾讯云关注的并非模型如何生成内容,而是从内容生成到稳定交付给用户之间的整条产业链路,包括预处理、质检、拼接、转码、分发、格式适配等关键环节。在生成式AI浪潮下,多媒体应用正面临多重挑战,直播、点播、媒体创作、互动等场景受限于网络传输、视频画质、用户体验及各类特性叠加,单一模型往往只能解决部分问题。许多厂商看到新的多模态大模型后,第一反应便是全部对接一遍,但对接后必然会遇到各式各样的故障。李郁韬观察到,如果每家遇到的问题高度相似,从客户反馈中就能提炼出一个共性诉求:应当有人帮他们把底层全部做好,让他们更专注于业务创新和上层应用。如何识别用户需求、找到能解决需求的模型、修补模型固有的缺陷,再将最终服务高效递交给用户,这正是音视频PaaS云服务厂商必须啃下的挑战。
早在今年6月5日的腾讯云AI产业应用大会上,腾讯云音视频便发布了AI品牌Tencent Cloud WAND,构建起6大自研媒体专用模型与60余项AI能力,覆盖内容生成、理解、处理、编码全链路,专门为电商、短漫剧、教育、赛事直播等垂直场景训练。李郁韬表示,团队会把所有模型串起来,不仅包括大语言模型,也涵盖多模态模型,甚至小参数量的画质提升模型和应用模型。他们去年就已动手打造多模态领域的Harness,恰逢今年生成式视频模型开始爆发,行业内外对Harness的概念和理解也愈发趋同。
值得留意的是,视频生成被业内视为继AI Coding之后,第二个跑通商业闭环的AI变现场景。今年以来,音视频大模型赛道竞争骤然加速,格局剧烈洗牌。国内厂商商业化进程凶猛:字节旗下Seedance与快手可灵AI形成了AI视频生成赛道的“双寡头”格局。公开数据显示,今年3月可灵AI的ARR已逼近5亿美元,一年内增长4倍;另有媒体报道称,截至上半年Seedance 2.0的ARR已达20亿美元,字节方面虽辟谣称该收入数据“偏高、与实际不符”,但也明确提及Seedance 2.0已跨过“生产力质变点”门槛。而在海外,今年3月OpenAI宣布停止Sora的独立App、API接口及ChatGPT内置视频功能,退出了消费级AI视频生成市场。
做To B的产品和解决方案,生态合作被李郁韬摆在战略首位。他也坦言,团队内部一直在讨论一个问题:当从生成到交互之间的链路被不断压缩,Harness这个生态位是否会被忽略乃至绕过?他的判断是,至少过去半年的观察表明不会,甚至Harness的重要性还会进一步加强。如果把大模型视为后端的生产力,生产力的提升会显著刺激前端应用需求的增长,且需求增长的广度将持续强于生产力的提升——大模型永远无法满足最终用户的极致需求,中间始终存在一个“供给关系差”,这正是Harness存在的必要性。
在他看来,腾讯云卡位多模态Harness,最大的机会在于:许多音视频场景的体验都值得重新做一遍。第二个机会点则是,未来会有更多、更强、更全面的模型涌现,如何快速将这些模型应用到企业级的生产服务中,让最终用户感受到最新的大模型体验,正是多模态Harness要解决的核心问题。而不断将最新模型应用于客户最前端,整套生产流程和工具链条就显得格外重要。
自去年开始,整个AI算力已从训练向推理倾斜,许多厂商构建推理算力的开销已超过训练投入,这也意味着大量AIGC应用开始进入大规模生产阶段。国内,短剧、漫剧制作是典型场景,目前已大量使用多模态技术进行生产。在亚太地区,音视频解决方案是腾讯云出海的“排头兵”,在收入、市场份额、行业心智方面均居行业第一。最近五年,腾讯云将国际化作为重要战略方向,投入大量业务资源和基础设施于海外布局,公司披露近三年海外业务保持两位数增长。
腾讯云音视频总经理李志成则提到,无论是短剧、漫剧还是电商、工具类场景出海,最大的共性在于:前期客户可能关注效果和影响力,但中后期都很关注ROI,即到底能否盈利、能产生多少价值。现在被问得最多的,就是短剧、电商工具的使用,未来1至2年预计会慢慢普及,许多用户和企业都会用起来,正如以前的大语言模型一样——两三年前更多是垂直行业在用,现在已基本全面普及,成为大家工作的一部分。
随着Agent时代到来,腾讯云前述能力还将与音视频智能体、AI硬件、具身机器人、云手机结合,依托全球基建与边缘推理,支撑AI应用快速跑向全球、就近上线。李郁韬介绍,团队目前已与逐际等多家具身智能企业、无人清扫车企业开展合作,孵化出TRRO远程实时操控(远程数智人解决方案),用于解决弱网情况下机器人人工介入时的低延时稳定通信、音视频数据回传等核心问题。
面向未来,李郁韬将云厂商在多模态领域的竞争归纳为三个方向。第一是多模态的训练和算力:与语言模型训练不同,多模态领域很大比例仍投在理解和生成上,未来将出现大量端到端的语音交互、端到端的视频生成,对算力的要求以及对云厂商基建的投入都很大。第二是存储和数据积累:多媒体相比文字对存储量要求更高,对存储稳定性、数据清洗和获取的要求也不一样,大量视频需要在预训练前完成数据清洗和处理,不同模态的数据需整合在一起,训练前所做的处理与文字类迥异。第三是应用生产端:云服务商提供更面向最终客户的推理服务、综合处理的应用能力,是影响客户选择的关键因素——创新趋势中产生的需求,如何以高效的方式在运营端满足客户,这一点对腾讯云同样至关重要。
[免责声明]如需转载请注明原创来源;本站部分文章和图片来源网络编辑,如存在版权问题请发送邮件至398879136@qq.com,我们会在3个工作日内处理。非原创标注的文章,观点仅代表作者本人,不代表本站立场。
