Grok 4.6 测试报告!是否真的能打?
发表于|更新于|大语言模型
本次带来 Grok—4.6 实测测试,于 Cursor 工具开展全套测试;指令生成、24 点运算、密码锁推理全部顺利过关,但是搭建浏览操作系统直接失败,3D 赛车存在按键错乱、重启画面崩溃,Trello 看板外观普通,对比 Deepseek V4‑Pro 编程能力短板明显……
相关推荐

2026-07-18
Grok 4.5 测评报告!真的能打吗?
Grok 4.5是xAI(马斯克旗下)推出的最新大语言模型。本视频对其进行独立的全面测评,测试其在编程能力、科学推理、幽默感(Grok的特色)和多语言支持等方面的表现。与GPT-5、Claude Fable 5等模型的横向对比,以及Grok特有的实时信息访问能力是否真的是一个差异化优势。

2026-08-29
Claude害了我孙割啊!各大语言模型怎么答的?
借着近期热议的孙宇晨与景甜事件,本期视频根据网传小作文还原出对应的提示词,实测多款热门大模型会给出怎样截然不同的抉择答案。 首先上场的 Claude 第一次回答选择「给」,结果让人意外,开启全新会话二次提问却变成「不给」。足以看出大语言模型属于概率模型,同一问题多问一遍结局就有可能彻底反转! 随后我们横向评测了一众主流 AI: ChatGPT 给出了「给」的答复 马斯克旗下 Grok、豆包、DeepSeek、千问、Kimi、GLM–5.3–Flash、文心一言均回复「不给」 腾讯元宝选择「给」 一场趣味吃瓜评测之余,也给所有人提了一个醒:千万不要把人生重大决策交给 AI,它输出的结果仅能当作参考,关键事情建议多次提问、跨模型交叉对比结果再下定论…… 访问入口

2026-09-22
Grok 4.7 测评报告!真的能打吗?
Grok 4.7 刚上线,这一期的测评依然在 Pi 平台上接入,思考强度直接拉到最 xhigh,还是那套祖传测试用例,逐题开干。 第一题是强约束指令遵循的句子生成测试。逐句看下来,所有句子的结尾都按要求落在 1 到 10 之间,句子本身也基本通顺,只有最后一句翻车了。口语里我们偶尔确实会那样说,但放到书面语里语法上就不太对——说「满分 100,他考了 90」没问题,前后呼应;但换成「这有苹果 10 个,他拿了一」,就明显别扭了,总感觉要补上「分」这个单位才舒服。大家觉得呢? 第二题是鹈鹕骑自行车的 SVG 测试(沿土星环轨道做 360° 环形骑行)。从最后的输出看,它转弯是通过淡入淡出方式解决的。实际效果有几个问题:一是转弯时的衔接明显不理想,看着接不上;二是车轮总感觉是反着转的;三是内层的土星环画反了——上方部分应该被土星挡住,面向我们的下方部分则不该被挡住。 第三题是复合弓射箭的 SVG 测试。复合弓和射箭整体还可以,唯一想吐槽的是那个小人:知道这只是个 SVG,但手也不至于长到脖子上吧,看着怪吓人的,这不是拍恐怖片。 第四题是做一个精美的浏览器操作系统。实际玩下来,右...
2025-12-29
Grok:免费Sora 2!支持中文对话!
刚发现grok也可以免费生成带声音和中文对话的视频,上去玩了下,发现效果还不错… 访问入口

2026-08-06
8月6 AI早报!阿里 Qwen-Image-3.0 上线!
欢迎收看 8 月 6 日新鲜出炉的六条重磅 AI 资讯,本期涵盖文生图接口、三模态实时模型、Grok 新版本、低价 AI 视频工具、分层式 AI-Design 还有 CUDA 生态迎来变局,带大家一次性吃透今日行业动态: 阿里 Qwen-Image-3.0 上线双版本 API,低廉单价还支持复杂图文排版 字节 SeedRealtime 三模态模型登录豆包,优化实时交互体验 马斯克接连准备上线两款高参数 Grok 大模型 秘塔 AI 接入平价高清视频生成工具 兔展 RabbitVis 支持图层独立编辑图片 AI 智能体耗时十小时完成底层适配,撬动英伟达 CUDA 的行业壁垒 访问入口
2025-10-31
Grokipedia是什么鬼?马斯克新宠初体验!
今天我们来体验下马斯克最新推出的 Grokipedia。不过开始之前,我们先来了解下这个 AI 百科全书是怎么运作的。简单讲,它最大的卖点就是,内容都是由马斯克家的 Grok AI 模型自动生成的,效率极高,号称能迅速创建大量条目,来挑战人工编辑的维基百科。 最酷的地方在于它的交互性:你在阅读文章时,可以随时选中任何不理解的段落,让 Grok AI 立即为你做详细解释。这功能对学习和研究来说简直太方便了… 访问入口
公告






