Qwen 3.8 Max 测评报告!究竟有多能打?
发表于|更新于|大语言模型
重量级新模型千问 3.8 Max 深度实测!
2.4 万亿超大规模参数,办公、编程能力全面升级,全球榜单稳居第一梯队,API 同步接入千问办公,下周即将开源。
全套标准测试推理题目全部满分,文本输出仅有两处小瑕疵;代码生成表现惊艳,桌面系统、太空射击游戏成品质量远多款竞品,3D 赛车体验流畅,Trello 看板基础拖拽功能齐全,仅少题目编辑入口,综合实力十分能打,开发、办公人群值得上手。
相关推荐

2026-07-19
Qwen 3.8 预览版测评报告,打得过Kimi K3吗?
千问 3.8 Max Preview 实测测评,对比此前 Kimi K3 的测评表现如何呢? 统一标准祖传测试用例实测,约束文本生成全对且速度更快,24 点、密码推理答题准确;编程项目生成效率大幅提升,浏览器系统配套太空射击游戏 UI 与功能完整,3D 赛车运行流畅无操控故障,复刻 Trello 看板还原度极高,仅缺少单条待办删除按钮一处小瑕疵。 对比 Kimi K3 存在答题失误、赛车失控、界面 bug 且生成耗时极长等短板,千问新版本综合实力更出众,响应速度优势突出。 关注 AI 产品狙击手,持续更新各类 AI 模型实测干货! 访问入口

2026-06-02
Qwen 3.7 Plus 测试报告!真的能打吗?
本期视频实测阿里巴巴通义千问最新发布的 Qwen 3.7 Plus,国产旗舰开源大模型系列高配版本。本期视频用祖传测试用力测评,看 Qwen 3.7 Plus 究竟能不能打。 访问入口

2026-05-21
Qwen 3.7 Max正式版!真的能打吗?实测报告!
本期视频带来千问旗舰模型 Qwen 3.7 Max 正式版实测。作为阿里通义千问迄今最强大的智能体模型,Qwen 3.7 Max 可自主完成长达 35 小时的复杂任务,在 Arena 全球大模型盲测总榜中位列国产第一,逼近 GPT、Claude、Gemini 第一梯队水平。视频从编程能力、办公自动化、长周期任务执行、多框架适配四大维度全面评测,解析这款模型究竟能不能打、适合哪些场景。 访问入口

2026-06-07
Qwen3.6 27B 测试报告!真的能打吗?
本期视频实测阿里巴巴通义千问最新发布的 Qwen3.6 27B 大模型,国产旗舰开源系列全新版本。27B 参数规模,主打更强推理与 Agent 能力。本期视频用祖传测试用力测评,看这款阿里旗舰模型究竟能不能打。 访问入口

2026-08-29
Claude害了我孙割啊!各大语言模型怎么答的?
借着近期热议的孙宇晨与景甜事件,本期视频根据网传小作文还原出对应的提示词,实测多款热门大模型会给出怎样截然不同的抉择答案。 首先上场的 Claude 第一次回答选择「给」,结果让人意外,开启全新会话二次提问却变成「不给」。足以看出大语言模型属于概率模型,同一问题多问一遍结局就有可能彻底反转! 随后我们横向评测了一众主流 AI: ChatGPT 给出了「给」的答复 马斯克旗下 Grok、豆包、DeepSeek、千问、Kimi、GLM–5.3–Flash、文心一言均回复「不给」 腾讯元宝选择「给」 一场趣味吃瓜评测之余,也给所有人提了一个醒:千万不要把人生重大决策交给 AI,它输出的结果仅能当作参考,关键事情建议多次提问、跨模型交叉对比结果再下定论…… 访问入口

2026-08-15
Qwen 3.8 27B(FP8) 测评报告!相当的能打!
Qwen-3.8-27B FP8 量化版本实测对比,相较于上期 Q4 版本表现更进一步,强约束指令生成全部通顺无重复字符,24 点、密码锁推理题全部答对;浏览器操作系统出现计算器计算错误,太空射击游戏存在小瑕疵,3D 赛车游戏运行正常、按键方向无误,Trello 看板功能完好,综合性能足以胜任日常办公、网页开发等常规编程需求…… 访问入口
公告






