详细介绍
产品定位
Sirchmunk 是阿里 ModelScope 团队开源的一款免向量智能搜索引擎,它能将原始数据实时转化为自进化的智能知识库。项目托管于 GitHub https://github.com/modelscope/sirchmunk,遵循 Apache 2.0 协议,可商用。其目标不是再做一个传统向量数据库式检索工具,而是让用户把文件直接放入后即可搜索,减少预处理和索引维护成本,同时通过知识簇让每次检索沉淀为可复用的知识。它适合关注数据私有化、低部署门槛和即时检索体验的个人、团队与开发者。
核心功能
它支持无索引检索,放入文件即可搜索,借助 ripgrep-all 流式搜索 100 多种文件格式,PDF、Word、Excel 无需预先解析切片;自进化知识簇 KnowledgeCluster 会把每次搜索结果结构化为可复用知识单元,存储在内存 DuckDB 表并定期落盘为 Parquet 文件,随查询验证从萌芽进化到稳定;蒙特卡洛证据采样采用探索与利用策略对文档区域采样评分,降低 LLM Token 成本;ReAct 智能体自适应检索在标准检索不足时,通过迭代推理与行动循环探索替代策略。集成方式包括 Web UI、Python SDK、CLI、REST、WebSocket、MCP,可对接 Claude Desktop、Cursor IDE。检索模式有 FILENAME_ONLY、FAST 和 DEEP:FILENAME_ONLY 仅文件名匹配,不读取内容、不调用 LLM;FAST 默认,贪心策略,2 至 5 秒完成,约 2 次 LLM 调用;DEEP 为完整管线,含蒙特卡洛采样和多轮 ReAct 推理,10 至 30 秒,适用于复杂查询。
技术特点
设计基于三大支柱:无嵌入,通过路径元信息和探测采样的智能推理定位目标文件,无需构建向量索引;自进化,知识簇随每次搜索进化;Token 高效,蒙特卡洛采样仅提取精确证据,无需读取全文。它不依赖静态向量嵌入和预计算索引,直接操作原始文件,无需预处理即可提供即时、完整保真度的检索。安装上,pip install sirchmunk 可快速开始,Web UI 用 pip install sirchmunk[web],MCP 支持用 pip install sirchmunk[mcp];环境要求 Python 3.10 以上、OpenAI 兼容的 LLM API Key,可用 Ollama、vLLM 等本地部署,数据留在自己机器上,Docker 四核 2G 可跑。需要说明的是,项目仍处于早期阶段,约 v0.0.3,底层为关键词匹配,语义泛化能力有限;DEEP 模式对 LLM 依赖较重,Token 消耗需关注;大规模生产环境稳定性尚待验证。另有技术分析指出,其知识簇的语义匹配仍使用 384 维 embedding,只是把向量从检索环节移到了知识复用环节,因此并非完全去向量化。
适用场景
适合需要把本地多格式文档快速变成可搜索知识库的场景,例如个人知识管理、团队资料检索、研发文档问答、合规与隐私敏感环境下的数据查询,以及希望借助 MCP 在 Claude Desktop、Cursor IDE 中调用检索能力的开发者。面对简单文件名查找可用 FILENAME_ONLY,日常快速查询可用 FAST,复杂问题可用 DEEP;也可通过 Python SDK、CLI、REST、WebSocket 集成到现有应用中。对于想低成本试用智能检索的团队,它提供 Docker 四核 2G 可跑的部署选项和本地 LLM 方案,能在数据不出机器的情况下完成检索与知识沉淀。但若追求强语义泛化、大规模生产级稳定性或极低 Token 消耗,应谨慎评估其早期版本局限。







