🛠️ AI 提效工具栈
自动化 Agent、本地大模型部署(Ollama / vLLM)、API 接入与二次开发。
这个方向在讲什么
模型本身不是终点,能不能便宜、稳定、可控地把模型跑起来才是。这个方向关注从本地部署到自动化串联的整条工具链。
涉及的核心工具
| 类别 | 代表工具 |
|---|---|
| 本地推理 | Ollama、LM Studio、llama.cpp |
| 高吞吐部署 | vLLM |
| 工作流 / Agent 编排 | Dify、n8n |
| 模型接入 | OpenAI / Anthropic 等官方 API、OpenRouter 等聚合服务 |
关键概念
- 量化:GGUF / AWQ / GPTQ 等格式,直接决定显存占用与推理速度。
- 显存与吞吐的权衡:上下文长度、并发数、批大小三者互相挤压。
- 推理服务化:把模型封装成 OpenAI 兼容接口,应用侧统一调用。
- Token 成本:输入 / 输出计费差异,缓存与精简上下文的收益。
- 工具调用(Function Calling / MCP):让模型能真正操作外部系统。
- 私有化部署:数据不出内网的前提条件与代价。
推荐学习路径
- 本地先跑通一个模型,感受参数量与速度的关系。
- 学会按显存选模型与量化档位。
- 把模型封装成 API,接入自己的脚本或应用。
- 用工作流平台把重复操作串成自动化。
- 补上工具调用 / MCP,让 Agent 真正「能干活」。
📄 本方向文章
内容整理中,后续笔记会补充到这里。
