MiniCPM V4.6:端侧开源视觉大模型!一键手机上直接跑!
发表于|更新于|大语言模型
MiniCPM-V4.6是面壁智能(OpenBMB)推出的端侧开源视觉大模型,最大的亮点是可以在手机上直接运行!虽然只有几B参数,但通过精心设计的模型架构和量化优化,它在视觉理解任务上的表现可以匹敌更大的模型。你可以在手机上安装后直接拍照提问——AI会实时分析图片内容并回答。对于移动端AI应用和离线视觉识别场景来说,这是一个重要的技术突破。
相关推荐

2025-01-31
Qwen 2.5-vl + Browser Use:打造本地Operator
通义千问版Operator啊!我们知道OpenAI推出的Operator震撼全球,可以像真人般操作浏览器去完成不同的任务。今天我们说下怎么用通义千问最新推出的开源免费的Qwen2.5-VL视觉大模型加上我们之前分享过的Browser Use来搭建本地跑的Operator… “Qwen2.5-vl API Server” github 入口 “Browser Use web-ui” github 入口

2024-12-26
QVQ-72B:世上唯一开源免费视觉推理大模型
这应该是当今世上唯一一个完全开源免费的视觉推理大模型,相比海外如OpenAI等贵的要命的o3模型,阿里巴巴最新推出的这个QVQ-72B视觉推理大模型遵循都是Apache 2.0的协议,也就是说权重等完全开源,如果我没有搞错的话,这应该是当今世上唯一一个完全开源免费的视觉推理大模型,它只有72B的参数量,但是它在MMLU多模态测试集和MathVision等数学视觉等测试集上的benchmarks得分却不容小觑。下面我们快速的去魔撘上玩下… 访问入口
2025-08-13
GLM 4.5V:AI视觉革命!开源即巅峰!
太炸裂了!上两周我才分享了智普AI的GLM 4.5表现不俗,这两天它们又发布了全新的开源视觉语言大模型GLM 4.5V。这款模型并非等闲之辈,它基于GLM 4.5 Air架构,拥有高达1060亿的庞大参数量,并激活120亿参数进行推理。在MMBench、MathVista及OCRBench等多项权威视觉基准测试中,GLM-4.5V均取得了接近90分的顶尖成绩,全面展示了其技术硬实力展开更多 访问入口

2026-05-18
NVIDIA NVLM:比看视频还快十倍!开源视觉模型天花板!
NVIDIA NVLM(NVIDIA Vision Language Model)是英伟达推出的开源视觉语言模型,号称”比看视频还快十倍”!它在视频理解和分析方面达到了惊人的速度——可以在极短的时间内分析整段视频的内容、识别物体和动作。被评价为”开源视觉模型天花板”。本视频测评NVLM在视频理解、图像分析和多模态任务上的表现。 访问入口
2025-09-03
FastVLM! 苹果炸裂开源视觉模型!本地就能跑!
苹果隆重推出最新力作FastVLM,这是一款旨在彻底改变我们与视觉内容交互方式的全新视觉语言模型!出道即王炸,它是目前市场上响应速度最快的VLM之一。想象一下,您的AI模型不仅能实时理解您眼前的一切,还能直接在浏览器中运行,甚至完全离线使用,不用联网就能看图看视频,甚至实时生成字幕。 对于希望在网页应用中集成高性能、低延迟的视觉智能的开发者而言,FastVLM无疑是理想之选。 模型访问入口 代码示例入口 在线访问入口
2025-10-21
Claude Haiku 4.5!短小但是精悍能干!
Anthropic的Haiku 4.5模型以惊人的速度和效率重新回到了人们的视野,为小型AI模型树立了新的性能标杆。短短五个月前,其前沿模型Sonnet 4还是业界翘楚,如今Haiku 4.5在编程性能上已能与之匹敌,而成本仅需三分之一,速度更是两倍。这不仅让其成为日常实时任务,如聊天助手、客户服务代理或结对编程的理想选择,更开启了多Agent协作、并行执行复杂任务的新篇章。Haiku 4.5超越了Sonnet 4在许多实际计算机使用任务中的表现,预示着AI辅助开发和自动化将迈向一个更高效、更经济的未来…展开更多 访问入口
公告





