MiniMind
MiniMind

MiniMind

大模型训练开源

从零训练大模型的开源项目,3块钱2小时训出64M模型

访问官网
收录: 2026-09-15·更新: 2026-09-15·开发框架

详细介绍

产品定位
MiniMind 是由 GitHub 用户 jingyaogong 发起的开源大语言模型项目,主打极低成本、极小体积和全流程可复现。它以约 3 元 GPU 租用成本、2 小时从零训练一个 64M 参数大语言模型为核心卖点,最小版本体积约为 GPT-3 的 1/2700,普通个人显卡即可完成训练与复现,并基于 Apache 2.0 协议完全开源。项目的核心价值不在于追求参数规模或榜单成绩,而在于把大模型从数据到训练、微调、对齐、推理与部署的完整链路尽量透明地呈现出来,让开发者能够真正理解每个环节如何工作。

核心功能
MiniMind 完整开源了极简结构与全流程训练代码,覆盖数据清洗、预训练 Pretrain、监督微调 SFT、LoRA、RLHF 中的 DPO、RLAIF 中的 PPO、GRPO、CISPO、SPO,以及 MoE 混合专家、Tool Use 工具调用、Agentic RL、自适应思考和模型蒸馏等方向。所有核心算法均使用原生 PyTorch 手写实现,不依赖第三方高层封装,力求每一行代码都能读懂。当前主线结构对齐 Qwen3 与 Qwen3-MoE 生态,Dense 模型约 64M,MoE 模型约 198M-A64M,已发布 minimind-3、minimind-3-moe 以及 minimind2、minimind-v1 系列。项目兼容 transformers、trl、peft、llama.cpp、vllm、ollama 与 Llama-Factory,支持单机单卡及 DDP、DeepSpeed 多卡训练,并提供 OpenAI API 兼容的极简服务端与 Streamlit WebUI。拓展方向包括视觉模型 MiniMind-V、多模态 Omni 模型 MiniMind-O、扩散语言模型 MiniMind-dLM 与线性模型 MiniMind-Linear。

技术特点
MiniMind 的技术特点可以概括为小、全、真、可动手。小是指模型参数和训练成本都很低,64M 级别模型让个人设备也能参与;全是指代码覆盖数据预处理、预训练、监督微调、偏好对齐、强化学习、MoE、工具调用、Agentic RL、蒸馏等关键阶段;真是指核心算法由原生 PyTorch 手写,不隐藏关键实现,不依赖难以拆解的高层封装;可动手是指训练、复现、微调、推理和部署都有对应路径,并能融入常见生态工具。这样的设计降低了理解大模型内部机制的门槛,也方便开发者做教学演示、快速实验和二次开发。

适用场景
MiniMind 适合想真正弄懂大模型工作原理、希望动手复现完整训练链路的开发者与学习者。它可用于高校教学、个人研究、算法实验、模型微调入门、强化学习对齐实践、MoE 与工具调用探索,也可作为轻量级模型训练与推理服务的基础项目。对于需要理解预训练、SFT、LoRA、DPO、PPO、GRPO、Agentic RL 等概念的读者,MiniMind 提供了从代码到运行的完整参考。对于希望在有限显卡资源下开展实验的团队,它也提供了低门槛验证想法、快速迭代和部署演示的可能。