谷歌 Gemini–3.8–Flash 测评报告出炉!此次依旧使用 V2.1 升级版祖宗测试用例,在 AI Studio 平台拉满思考深度进行实测。约束束句子生成全部十条通顺达标;新版 24 点三道解法全部合规正确;高难度 7 位密码锁推理顺利答对,单论推理表现甚至优于 Fable 5.1。

来到编程项目,浏览器操作系统 UI 精致,弹窗、Dock 栏运行正常;太空射击游戏具备 3D 效果,但同时按下方键和空格会中断射击,碰撞缺乏反馈效果;3D 赛车游戏画面简陋,车辆存在漂移问题;Trello 看板卡片拖拽正常,但是列表拖动换位功能失效。

综合整套测试,这款模型推理实力亮眼,不过代码实现方面还有不少短板有待优化……