步骤 01 / 先准备运行环境
环境配置
LM Studio 提供了一个可视化本地大模型运行环境,降低模型部署门槛,先确认硬件、运行时和模型格式,再开始下载,后面排查问题会轻松很多
个人研究 / 本地智能
从本地部署开始,探索开源模型的发展与边界
探索开源模型的本地能力
01 / 本地部署
第一次真正运行本地模型时,最大的限制不是模型能力,而是显存和推理效率,这里记录我用 LM Studio 把模型从文件变成可交互实例的过程
接下来可以把注意力放到模型本身,而不是安装过程
02 / 我的模型
模型不是越大越好,它和硬件、任务、耐心共同决定一次本地实验是否值得
03 / 硬件配置
同一个模型换一台机器,体验可能完全不同,显存、统一内存和生态,往往比纸面参数更先决定结果
M 系列芯片采用统一内存架构,CPU 和 GPU 共享内存,适合运行 MLX 以及量化后的 GGUF 模型
CUDA 生态成熟,但显存容量成为限制模型规模的重要因素,小模型和明确的 GPU Offload 策略更重要
模型规模探索
速度、质量和硬件要求之间比较容易取得平衡,适合先验证一条本地工作流
04 / 模型格式
格式是部署体验的一部分,它不决定模型聪不聪明,却会改变模型如何使用你的硬件
llama.cpp 生态
兼容性强,资源丰富,Windows / Linux / macOS 均支持
Apple Silicon 优化不一定最佳
Apple Silicon 原生
M 系列芯片优化明显,内存利用效率高,Mac 本地体验优秀
生态规模小于 GGUF,平台限制明显
05 / AI 演进
从预训练的一颗种子,到推理、多模态与 Agent 交织成枝。沿着主干向下,看见大语言模型如何一点点长成今天的树冠。
06 / 未来探索
下一步想记录的不只是模型跑分,还有它们在真实工作流里的摩擦:工具调用、记忆、Agent,以及更低成本的多模态部署
交换一个想法 ↗