大语言模型的深度思考究竟是什么鬼?
发表于|更新于|大语言模型
大家知道大语言模型的深度思考模式是怎么工作的吗? 这两天deepseek 不是发布了3.2正式版本嘛,在以前的化,我们开启深度思考,事实上会切换另外一个叫做R1的模型,而现在。据说用的是同一个模型,只是打开了深度思考模式而已…
相关推荐
2025-12-12
DeepSeek特别版测评!硬刚GPT-5?
测评下可以硬刚GPT 5的DeepSeek 3.2 Special版本。据说主要是在推理和数学上做了提升。所以准备测几道推理题,顺便也测两道编程题看看。因为这个版本只能通过API访问,所以我们直接到OpenRouter中测评…
2025-12-03
DeepSeek杀回来了!V3.2 吊打GPT 5!
DeepSeek 又杀回来了!DeepSeek 有段时间没有什么动静了,最近几天却动作频频,意欲何为呢?上几天才出了个 DeepSeek Math V2,今天 DeepSeek V3.2 又来了… 访问入口
2025-12-03
拳打GPT-5?DeepSeek V3.2测评报告!
DeepSeek憋了这么久,终于憋出了个V 3.2, 看benchmarks的话是拳打GPT 5, 脚踢 Gemini 3.0。但是不是真的能打,我们还是得亲自测评下。来到DeepSeek, 打开思考模式吧。我这里打开思考模式的话,不知道是否会切换到他们推出的号称超过GPT 5的special特别版,但愿是吧。好,开始… 访问入口
2024-11-29
Gradio:如何几行代码实现一个大语言模型GUI应用
Gradio是Hugging Face开发的一款Python库,让你只需几行代码就能为大语言模型或机器学习模型创建漂亮的Web GUI界面。对于AI开发者来说,构建前端界面往往是最头疼的部分——Gradio完美解决了这个问题。你只需定义输入和输出组件(如文本框、图片上传、下拉菜单等),Gradio会自动生成一个可交互的Web应用,支持共享链接、队列管理和暗色模式。无论是构建ChatGPT风格的聊天界面、图片分类器演示还是AI工具原型,Gradio都能在几分钟内搞定。 官网

2026-05-25
llama.cpp 正式支持MTP!本地推理速度大幅提升!
llama.cpp(最流行的本地大模型推理框架)正式支持MTP(Multi-Token Prediction,多Token预测)技术!MTP让模型在推理时一次预测多个Token,而不是逐个Token生成,从而显著提升推理速度(预计提升2-3倍)。对于在本地运行大模型的用户来说,这是一个重要的性能升级。本视频介绍MTP的原理、配置方法和实际速度提升测试。 访问入口

2025-02-08
DeepSeek是怎么做到的?
首先,我们看数据,V3训练用了2788K的GPU Hours,相当于一块GPU用了近300多年,而他们用了2000块GUP,所以用了越2个月时间就训练出来了。对比下LLama 3.1 405B, 它们用了近3100万个GPU Hours来训练,deepseek的11倍还多,同时还要考虑deepseek用的GPU肯定是没有人家老美的性能好的,这也就是为什么V3的训练花费比海外这些同等级别模型低几个数量级的原因,从而打破老美的算力霸权,也打破了顶尖大模型只能掌握在OpenAI和谷歌这些屯了大量卡的大公司的垄断… 官网入口
公告





