平时测评 AI 工具我一般都会先讲痛点,而这款微软开源项目直接看 53.5K 的 Star 数量,就值得先收藏再说。它最亮眼的能力就是一次性处理 60 分钟长音频,不用手动切割分片。市面上绝大多数 ASR 识别工具遇到长录音都需要拆分音频,拆分之后很容易造成上下文断裂,原理和 RAG 文档分片问题十分相似,切割后的片段丢失全局语义,识别总结效果大打折扣。而它完整保留一小时音频的全部上下文,最适合一小时时长的会议录音一键生成纪要,也可以二次开发做成智能录音笔类应用,衍生玩法想象空间巨大。模型体积仅 1.58G,CPU 环境就可以直接运行,无需高配显卡,企业部署门槛很低……