Minimind,自己动手实现 LLM,2 小时训练一个大模型!
先看成果:一个只花了三块钱训练出来的大语言模型,聊起来还可以。如果你想真正弄懂大语言模型的工作原理,或者想知道一个大模型到底是怎么训练出来的,这个叫 MiniMind 的开源项目必须要收藏——花 3 块钱租一张 3090,两个小时就能从零开始训练出属于你自己的大语言模型。
这个项目目前在 GitHub 上已经涨到 6.1 万颗星、近 8000 个 fork。训出来的模型只有 6400 万参数,体积大概是 GPT-3 的两千七百分之一,普通个人显卡就能跑得动训练。整个流程也很简单:把仓库克隆下来,装好依赖,下载它开源的数据集,跑一条预训练命令,再补一条微调命令,就能得到一个小巧但会中文聊天的模型。之后还能直接用 Ollama 拉起来跑,或者通过 OpenAI 兼容接口接到 OpenWebUI 里。
真正少见的是,作者把 MoE、LoRA、DPO 强化学习、蒸馏、工具调用这一整条链路的核心算法,全用原生 PyTorch 手写了一遍,没有藏在第三方封装后面,你跟着练的同时每一行都能看懂。项目甚至还延伸出了视觉和多模态的孪生项目。
想认真搞懂大模型这个黑盒的人,不妨先拿家里那张显卡,把两小时的 mini 版训一遍玩玩。












