个人研究 / 本地智能

AI Lab

从本地部署开始,探索开源模型的发展与边界

探索开源模型的本地能力

当前关注部署 · 观察 · 记录
01本地 / 开源

01 / 本地部署

把模型
跑起来

第一次真正运行本地模型时,最大的限制不是模型能力,而是显存和推理效率,这里记录我用 LM Studio 把模型从文件变成可交互实例的过程

选择模型下载量化推理
LM STUDIO / FIELD GUIDE
01 / 04

步骤 01 / 先准备运行环境

环境配置

LM Studio 提供了一个可视化本地大模型运行环境,降低模型部署门槛,先确认硬件、运行时和模型格式,再开始下载,后面排查问题会轻松很多

硬件LM Studio模型格式运行环境
01硬件先看内存
02运行环境桌面应用
03准备完成本地推理

02 / 我的模型

我的
模型

模型不是越大越好,它和硬件、任务、耐心共同决定一次本地实验是否值得

正在加载模型记录

03 / 硬件配置

硬件
边界

同一个模型换一台机器,体验可能完全不同,显存、统一内存和生态,往往比纸面参数更先决定结果

01 / APPLE SILICONM1 Max
32GB 统一内存

M 系列芯片采用统一内存架构,CPU 和 GPU 共享内存,适合运行 MLX 以及量化后的 GGUF 模型

适合7B14B部分 32B 量化模型
02 / CUDA DESKTOPRTX 4070
8GB 显存

CUDA 生态成熟,但显存容量成为限制模型规模的重要因素,小模型和明确的 GPU Offload 策略更重要

适合7B 模型部分 14B 量化模型

模型规模探索

7B / 实用的起点

速度、质量和硬件要求之间比较容易取得平衡,适合先验证一条本地工作流

理解能力 ↑显存需求 ↑推理速度 ↓

04 / 模型格式

GGUF
vs MLX

格式是部署体验的一部分,它不决定模型聪不聪明,却会改变模型如何使用你的硬件

格式优势场景取舍
GGUF

llama.cpp 生态
兼容性强,资源丰富,Windows / Linux / macOS 均支持

Apple Silicon 优化不一定最佳

MLX

Apple Silicon 原生
M 系列芯片优化明显,内存利用效率高,Mac 本地体验优秀

生态规模小于 GGUF,平台限制明显

05 / AI 演进

一条仍在
变化的线

从预训练的一颗种子,到推理、多模态与 Agent 交织成枝。沿着主干向下,看见大语言模型如何一点点长成今天的树冠。

生长记录 / 2018 - 2026向下生长
正在加载时间线

06 / 未来探索

继续把
问题留下

下一步想记录的不只是模型跑分,还有它们在真实工作流里的摩擦:工具调用、记忆、Agent,以及更低成本的多模态部署

交换一个想法