阿里 Qwen 团队发布 Qwen3.8-Omni-Flash,自称首个围绕智能体能力构建的全模态模型:接受文本、图像、音频与视频输入,输出文本,把视听理解、推理与工具调用放进同一个模型,工作流被概括为理解内容、规划任务、用工具执行、交付结果。它基于 8 月开源的 Qwen3.8-Flash-Next 架构,上下文 100 万 token(最大输入 991K、最大输出 131K、最大推理长度 262K),默认开启思考,reasoning_effort 默认为 xhigh。API 同时兼容 DashScope 与 OpenAI 协议,支持函数调用、联网搜索、结构化输出、上下文缓存与批量调用,目前只有托管 API,未公布开放权重。在长视频上它让智能体从问题出发决定看什么听什么、分多轮由粗到细取证,OmniVideoBench 准确率从 63.4 提升到 67.8,token 用量从 145736 降到 79117,减少约 45.7%。官方称音视频表现接近 Gemini 3.8 Flash。