MacBook Pro M5 Max用了五个月:本地AI跑到150Token秒,128GB内存还能撑多久?(MacBook Pro apple M5) ypxx.net

作者 | 张建imest

来源 | 至顶AI实验室

一台配备128GB内存的高配MacBook Pro,跑本地AI已经能达到怎样的程度?在国外视频网站发布的视频中,Karthik给出了五个月使用后的答案:短交互的生成速度达到约150个Token/s,部分.NET项目迁移任务不到五分钟完成。但同一份体验里,他也开始担心,128GB内存可能很快不够用。

这个矛盾,正是现在值得关注这台机器的原因。按照他的使用记录,本地模型已经进入编程、微调和内容制作流程。与此同时,部分更大模型的内存需求也在逼近设备上限。对正在考虑购买本地AI电脑的人来说,难题已经具体到:今天足够流畅的配置,能否装下明天想用的模型?

Karthik此前就曾分享过在M5 Max上运行Qwen,并接入编程代理的尝试。这次,他把五个月的日常使用放在一起回看,呈现出两种并存的体验:现有工作做得很顺,对未来容量却没有同样的把握。

“有时候感觉就像在连接云端模型”

“有时候感觉就像在连接云端模型。”这是Karthik对本地编程体验的形容。

他的工具栈包括LM Studio、oMLX、MTPLX、Ollama和llama.cpp,并搭配Pi、Codex等编程代理使用。模型覆盖Qwen、Gemma、GLM,以及他提到的Muse/Glimmer。这台M5 Max已经成为他的日常工作电脑。

用途也延伸到了视频制作。本期视频就是在这台机器上录制的。他还用Final Cut Pro和Camtasia处理视频工程,加入多种素材并完成渲染。大内存的价值因此贯穿多个任务,而不局限于加载模型。

他将部分性能改善归因于更高的内存带宽。苹果官方规格显示,40核GPU版本的M5 Max内存带宽为614GB/s,并支持128GB统一内存。

对Karthik而言,这台电脑的吸引力在于,它能同时承担本地AI实验和日常生产任务。模型运行结束后,同一台机器还能继续编程、录制课程和剪辑视频。

每秒150个Token,是怎样跑出来的?

108个Token/s,随后约150个Token/s,是本期最直观的两组速度读数。

演示中,Karthik使用oMLX加载了他称为Gemma 4 26B A4B的MoE模型,采用4比特量化,并开启Lightning MTP。首次交互需要先加载模型,随后,他打开活动监视器,指出当时内存使用量约为46GB,内存压力较低。

这里的46GB是系统内存使用读数,不能直接视为模型本身的独立占用。

第一次交互中,界面显示约108个Token/s,再次输入“Hi”后,读数升至约150个Token/s。这样的响应速度,让他觉得本地推理已经相当流畅。

但短问候下的生成速度,不能直接换算成长文分析或代码迁移的完成速度。视频中没有提供固定的长提示词、输出长度和多轮重复测试,因此这些数字主要反映特定模型与配置下的现场体验。

Karthik自己也承认,耗时会随上下文、请求内容和模型配置变化。他使用Qwen 3.8 27B、Qwen 3.8 Flash Next以及GLM-5.3 Flash时,有时仍需要等待较长时间。能够完成任务,与始终即时响应之间,依然有距离。

五分钟迁移项目,比一句“Hi”更接近实际工作

把项目从.NET 8迁移到.NET 10,是Karthik举出的一个开发案例。

按照他的描述,本地模型可以协助更新项目,包括调整NuGet依赖包。使用MTPLX时,这类迁移有时不到五分钟就能完成。另一个常用案例是生成SVG图像:模型输出图形代码,让他迅速得到可查看的结果。

这些任务解释了他为何重视编程代理。模型进入开发流程后,价值体现为完成具体修改所需的时间,以及能帮使用者处理多少工作。

不过,视频中并没有给出迁移项目的规模、测试覆盖情况或完整验收结果,也没有提供MTPLX与oMLX在相同条件下的逐项对照。“不到五分钟”因此应保留为他对特定任务的经验描述,不能推广为任意.NET项目的升级周期。

本地模型已经能参与实际开发,任务是否完成仍需要项目验证。代码输出得快,是体验改善的一部分。修改之后能否正常编译、运行,才决定这段时间有没有真正省下来。

模型变大,风扇也开始持续运转

风扇的变化,是Karthik每天都能感受到的差别。

按照他的描述,运行较小模型时,机器通常比较凉爽,常规推理也较平稳。换成Qwen 3.8 Flash Next这样的更大模型后,发热明显增加,风扇会持续工作。视频中没有提供温度、功耗或噪声测量,这部分属于他的主观使用感受。

他还使用Unsloth MLX进行模型微调,并认为表现令人满意。不过,视频没有说明训练数据量、具体训练方式和耗时,不能据此判断它能够承担多大规模的训练。

与此前使用的M1 Max相比,他形容部分性能提升最高达到八倍,并提到提示词处理、图像生成和训练体验都有改善。

这份体验能够说明的是,他已经在同一台机器上持续进行推理、微调、编程与剪辑。它覆盖的工作范围相当广,但不同任务分别快了多少,本期材料不足以给出统一答案。

128GB的余量,正在被更大的模型吃掉

Karthik提到,他接触的部分新模型在使用中会出现接近121GB、122GB的内存相关读数,逼近整机128GB的配置。操作系统以及运行模型所需的其他开销,也要占用空间。

他的核心顾虑仍然清楚:如果未来想用的模型需要192GB或256GB内存,128GB就无法继续提供足够的容量余地。

他设想,未来可能出现能力接近Claude Opus、又可以本地运行的模型,但内存需求将远超过这台电脑的上限。

也正因如此,他一方面认为当前配置足够强,另一方面又担心它可能在两年左右失去满足最新本地AI需求的能力。

买得早的庆幸,抵不过对容量的疑问

回看购机时机,Karthik仍觉得自己买得划算。

他回忆,4月购买这台机器时花费约11,599新西兰元,后来看到相同机器的价格上涨约5,000新西兰元,并将其归因于内存涨价。

比价格更让他在意的,是昂贵设备能用多久。过去,他认为一台Mac可以持续使用很多年。面对快速增长的模型需求,他对这种预期产生了动摇。

Karthik已经证明,这个配置能在现阶段的日常工作中发挥作用,至于它能否持续容纳未来更大的模型,五个月的良好体验还给不出保证。