多模态决策大模型迎来开源新突破!Cloudflare 正式发布 Clef-omni,全面支持音视频原生输入

Cloudflare发布全新开放权重决策模型Clef-omni,首次实现文本、图像、音频和视频的统一处理。该模型基于Qwen3-Omni-30B-A3B-Instruct架构构建,支持wav、mp3、mp4和webm等主流音视频格式。性能方面,纯文本响应时间约130毫秒,图像处理约150毫秒,21秒视频处理仅需1.5秒。同时Clef-flash输入价格下调58%,从每百万Token 0.09美元降至0.038美元,为全球开发者构建智能工作流提供更高效的底层支撑。

文章作者、来源:Cloudflare

Cloudflare近期正式发布了全新开放权重决策模型Clef-omni。该模型在原有Clef系列的基础上实现了重大升级,不仅原生支持文本与图像,更首次新增了对音频和完整视频输入的直接处理能力。目前,其模型权重已在HuggingFace平台全面开源。

在技术实现与功能特性方面,Clef-omni彻底改变了传统的处理链路。此前版本的Clef在面对视频输入时,往往需要先将视频按时间轴拆解为连续的静态图像再进行处理;而全新的Clef-omni则直接支持wav、mp3、mp4和webm等主流音视频格式。这意味着开发者无需再单独搭建复杂的语音转写及音视频拆分管道,只需通过单次API调用即可实现文本、图像、音频和视频的统一处理。

image.png

从性能与基准测试表现来看,该模型基于Qwen3-Omni-30B-A3B-Instruct底座架构构建,完整保留了其核心理解能力。作为一款专注于结构化决策任务的专用模型,它不输出常规的冗长文本。在官方公布的实测数据中,纯文本请求的中位响应时间约为130毫秒,图像请求约为150毫秒;而处理一段带有声音、时长达21秒的视频,也仅需约1.5秒即可高效完成评分。

伴随着新模型的登场,Cloudflare还对旗下其他产品线进行了价格调整与优化。其中,Clef-flash的输入价格迎来了约58%的大幅下调,从原本每百万输入Token0.09美元降至0.038美元,托管版的上下文窗口则同步由64k调整为24k。整体来看,随着Clef-omni的开源以及多模态处理能力的补齐,正为全球开发者构建复杂的智能工作流和自动化决策系统提供更高效、更具性价比的底层支撑。