AI风向局
26-06-03 09:13

Qwen3.7-Plus发布了
【硬核拆解】Qwen3.7-Plus 的四大“进化超能力”
1️⃣ 史诗级“视觉编码与理解”:别想用烂画质糊弄它
以前的多模态模型看图片,顶多能识别出“这是一张发票”或者“图里有一只猫”。
Qwen3.7-Plus 引入了全新的视觉编码架构。不管是高密度的建筑工程图纸、密密麻麻布满数字的金融财报图表,还是极其复杂的医学影像,它都能像素级吃透每一个细节,并直接转化为结构化的机器语言。
2️⃣精准的 GUI(图形界面)操作:它能看懂你的屏幕
结合了强悍的视觉理解后,Qwen3.7-Plus 拥有了顶级的人机界面操控能力。
前几天 OpenAI 的 Codex 刚在 Windows 上解锁了 Computer Use。而 Qwen3.7-Plus 作为基座模型,原生就具备极强的 GUI 识别与定位能力。你把手机或电脑的屏幕截图丢给它,它能一秒识别出每个按钮、每个输入框在哪里,并准确给出下一步的点击、拖拽或输入指令。这是把任何传统软件一秒变成 AI Agent 驱动的绝对神器。
3️⃣“真实世界推理”能力:它开始理解人类的常识
这次 Plus 版本最玄妙的升级在于真实世界推理(Real-world Reasoning)。
它不仅能看懂静态的图,还能理解视频、连续动作以及物理世界的常识。比如看到一张凌乱的厨房照片,它能推理出主人刚才做了什么菜、缺什么调料,并自动去外卖软件里加购。这种把视觉信号与人类生活逻辑无缝绑定的能力,让它在生产力工作流里变得极其聪明。
4️⃣满血保留的“打工全家桶”:Coding 与工具调用依然是天花板
很多模型搞了多模态,写代码和逻辑推理就会退化,但 Qwen3.7-Plus 保持了极其完整的智能体操控能力。
它的 Coding、高级工具调用(Tool Calling)以及长周期生产力工作流 能力没有受到任何阉割。它一边看着设计图,一边就能在后台把全套的前端代码、数据库架构给你写完调通。

【开发者直达指南】
1️⃣百炼平台已同步: 阿里云百炼平台目前已经向部分企业和开发者定向开放 Qwen3.7-Plus 的多模态 API 测试,据说其长文本和多图输入下的 Prompt Caching(提示词缓存)技术做得极好,能帮企业省下大笔的算力开销。
2️⃣尝鲜建议: 建议想搞自动化办公流、网页自动爬取与操作、或者多模态电商客服的局友,立刻去后台申请接入,体验一下什么叫“带眼睛的赛博打工仔”。

发布于 河北