Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付 · AIHOT

空逐月AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-09-18254 阅读💛 96 收藏
Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付 · AIHOT

📌 One-Sentence Summary 阿里巴巴发布 Qwen3.8-Omni-Flash,这是一款原生全模态模型,旨在将音视频和文本的处理从简单的内容理解转向智能体任务交付。 📝 Summary Qwen3.8-Omni-Flash 是一款次世代原生全模态模型,具备 1M token 的上下文窗口,并在音视频智能体任务中实现了显著的性能提升。该模型超越了被动感知,专注于「智能体交付」——即通过规划、工具调用和执行复杂工作流,实现专业视频剪辑、音乐视频创作以及自动化的「会议-行动」流水线。此外,它引入了用于长内容处理的 Qwen-MM-Plugins 和用于实时交互的 Qwen-Live Harness。值得注意的是,该模型展现了驱动自身开发的能力,能够优化更小的模型(例如提升 Qwen2.5-Omni-3B 的方言识别能力),并通过 Video2Note 等工具提供高效的信息压缩。 💡 Main Points 从感知转向智能体交付 模型从单纯的「理解」转向「执行」,通过任务规划和工具调用,在视频剪辑、翻译和内容创作中实现端到端的工作流。 先进的长篇音视频理解 采用智能体方法选择性地处理相关视频片段而非整个流,在提高准确率的同时,在 OmniVideoBench 上将 token 消耗降低了约 45.7%。 实时全模态交互 Qwen3.8-Omni-Flash-Realtime 变体支持低延迟交互,具备发音与语义的联合建模(用于语言练习)以及空间音频感知(用于目标定位)。 LLM 驱动的模型优化 展示了「大模型驱动小模型」的范式,Qwen3.8-Omni-Flash 能够独立诊断并提升 Qwen2.5-Omni-3B 的四川话识别能力,将 CER 降低了 40.7%。 高效信息压缩 通过 Video2Note(生成 PDF)和 Omni Skill Creator(从专家演示中提取 SOP)将非结构化视频数据转化为结构化资产。 💬 Key Quotes 将全模态模型从「理解全模态内容」推向「规划任务、调用工具并完成创意工作」。 音频和视频正从感知输入演变为智能体理解环境、推理并执行任务的核心媒介。 一种处理长篇音视频理解的智能体方法……它能自主决定观看和聆听的内容,并通过多轮由粗到精的证据收集来定位关键信息。 📊 Article Meta AI Screening: 86 Source: AIHOT — 精选 Author: noreply@aihot.news (Qwen:Blog Retrieval(API)) Category: 人工智能 Language: 英文 Read Time: 45 min Word Count: 11108 Tags: AI 与智能应用 , 多模态 AI , AI Agent , 模型发布 , AI 工作流 Read Full Article

#AI 与智能应用# 多模态 AI# AI Agent# 模型发布# AI 工作流

文章评论(0

暂无评论,快来抢沙发~