Files
ai-startup/本地模型好用落地设计.html
2026-08-05 17:25:15 +08:00

141 lines
13 KiB
HTML
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
<!DOCTYPE html>
<html lang="zh-CN">
<head>
<meta charset="UTF-8">
<meta name="viewport" content="width=device-width, initial-scale=1.0">
<title>本地模型好用落地设计 v1.0EVO-X2 128GB 平台)</title>
<style>
:root{--ink:#1A2433;--muted:#6B7A8F;--navy:#13315C;--blue:#2E93F7;--orange:#FF8A3D;--bg:#F4F7FB;--card:#FFFFFF;--line:#E3EAF2;--green:#2E9E6B;--red:#D9534F;}
*{box-sizing:border-box;margin:0;padding:0;}
body{font-family:"Microsoft YaHei","PingFang SC",sans-serif;background:var(--bg);color:var(--ink);line-height:1.65;font-size:14px;}
.wrap{max-width:1000px;margin:0 auto;padding:32px 24px 80px;}
.hero{background:linear-gradient(135deg,#0B2545 0%,#13315C 60%,#1E6FB8 100%);color:#fff;border-radius:14px;padding:36px 44px;margin-bottom:26px;}
.hero .tag{display:inline-block;background:rgba(46,147,247,.25);border:1px solid rgba(46,147,247,.5);color:#BBD6F2;padding:3px 12px;border-radius:20px;font-size:12px;margin-bottom:12px;}
.hero h1{font-size:25px;}
.hero .sub{color:#BBD6F2;margin-top:8px;font-size:14px;}
.hero .params{margin-top:18px;display:flex;flex-wrap:wrap;gap:10px;}
.hero .params span{background:rgba(255,255,255,.08);border:1px solid rgba(255,255,255,.16);padding:6px 14px;border-radius:8px;font-size:13px;}
h2{font-size:20px;color:var(--navy);margin:42px 0 6px;display:flex;align-items:center;gap:10px;}
h2 .no{background:var(--navy);color:#fff;width:30px;height:30px;border-radius:8px;display:inline-flex;align-items:center;justify-content:center;font-size:15px;flex:0 0 auto;}
.sec-desc{color:var(--muted);margin-bottom:16px;font-size:13px;}
table{width:100%;border-collapse:collapse;background:var(--card);border-radius:12px;overflow:hidden;border:1px solid var(--line);font-size:13px;margin-bottom:14px;}
th{background:var(--navy);color:#fff;padding:9px 12px;text-align:left;font-weight:600;}
td{padding:9px 12px;border-top:1px solid var(--line);vertical-align:top;}
tr:nth-child(even) td{background:#FAFCFE;}
td .w{font-weight:600;color:var(--navy);}
.box{background:var(--card);border:1px solid var(--line);border-radius:12px;padding:16px 20px;margin-bottom:14px;}
.box h4{color:var(--navy);font-size:15px;margin-bottom:8px;}
.box ul,.box ol{padding-left:20px;}
.box li{font-size:13px;padding:3px 0;}
.key{background:#F2F8FE;border:1px dashed var(--blue);border-radius:10px;padding:12px 16px;margin:12px 0;font-size:13px;}
.key b{color:var(--navy);}
.ok{display:inline-block;font-size:11px;font-weight:600;color:#fff;background:var(--green);border-radius:8px;padding:0 7px;margin-right:4px;}
.no{display:inline-block;font-size:11px;font-weight:600;color:#fff;background:var(--red);border-radius:8px;padding:0 7px;margin-right:4px;}
.part{display:inline-block;font-size:11px;font-weight:600;color:#fff;background:var(--orange);border-radius:8px;padding:0 7px;margin-right:4px;}
footer{margin-top:44px;text-align:center;color:var(--muted);font-size:12px;}
</style>
</head>
<body>
<div class="wrap">
<div class="hero">
<span class="tag">技术落地设计 · 在 EVO-X2 128GB 硬件上确保"真正好用" · v1.0</span>
<h1>本地模型好用落地设计</h1>
<div class="sub">核心问题:35B MoE 与 27B 稠密特调"用哪个加载哪个",如何确保客户真正用起来、能替代多少 API 能力。答案:EVO-X2 的内存预算足够同时驻留主力模型,按任务路由即可;销售型生产企业 80–90% 的数据服务场景本地可替代。</div>
<div class="params">
<span>平台:<b>EVO-X2 128GB</b>96GB 可分 GPU / 256GB/s</span>
<span>策略:<b>多模型同时驻留 + 按任务路由</b></span>
<span>替代率:<b>本地覆盖 80–90%,云端只兜底 10–20%</b></span>
</div>
</div>
<!-- 1 内存预算 -->
<h2><span class="no">1</span>内存预算:多模型同时驻留可行</h2>
<div class="sec-desc">EVO-X2 128GB 统一内存、可分配 96GB 给 GPU——这决定了你<b>不用"加载一个卸一个"</b>,主力模型可以常驻,切换近乎无感。Ollama 原生支持多模型常驻(keep_alive)。</div>
<table>
<tr><th>模型</th><th>量化</th><th>占用</th><th>用途</th><th>驻留策略</th></tr>
<tr><td class="w">Qwen3.6-35B-A3BMoE,激活 3B</td><td>Q5_K_M</td><td>≈25GB</td><td>通用分析:周报/归因/问答/深度分析(<b>主力</b></td><td><b>常驻</b>keep_alive=-1</td></tr>
<tr><td class="w">Qwen 27B 稠密(特调版)</td><td>Q4_K_M</td><td>≈20GB</td><td>特调业务场景:固定格式输出、行业术语(<b>备用主力</b></td><td>按需加载(业务批处理时)</td></tr>
<tr><td class="w">Qwen3-14B</td><td>Q5_K_M</td><td>≈10GB</td><td>规则任务:查数、工具调用、格式提取(快)</td><td><b>常驻</b></td></tr>
<tr><td class="w">bge-m3(嵌入)</td><td>fp16</td><td>≈2GB</td><td>RAG 向量化</td><td><b>常驻</b></td></tr>
<tr><td class="w">KV cache(32K 上下文 × 常驻模型)</td><td></td><td>≈812GB</td><td>长上下文缓存</td><td></td></tr>
</table>
<div class="key">✅ 合计常驻约 4549GB35B MoE + 14B + 嵌入 + KV),加 27B 特调也仅约 65–69GB —— 远小于 96GB 可用额度,<b>还剩 30GB 余量</b>。结论:不用做"加载卸载"的取舍,四个模型可以同时住在内存里,Agent 按任务路由即可。</div>
<!-- 2 用哪个加载哪个 -->
<h2><span class="no">2</span>"用哪个加载哪个":模型路由规则</h2>
<div class="sec-desc">MoE 和稠密特调不是二选一,是<b>分工</b>。默认 MoE 干活,特调只在特定场景顶上。</div>
<table>
<tr><th>任务类型</th><th>用哪个</th><th>为什么</th></tr>
<tr><td class="w">经营分析 / 周报 / 归因 / 深度问答</td><td><b>35B MoE(常驻)</b></td><td>通用推理强、速度快(25–35 Token/s),覆盖 80% 场景</td></tr>
<tr><td class="w">固定格式输出(特定报表/单据)</td><td><b>27B 稠密特调(按需)</b></td><td>微调后输出格式绝对稳定、术语准确——但只在真的需要时才上</td></tr>
<tr><td class="w">查数 / 工具调用 / 简短提取</td><td><b>14B(常驻)</b></td><td>快、省,杀鸡不用牛刀</td></tr>
<tr><td class="w">文档检索问答(RAG</td><td>bge-m3 检索 + 14B/35B 生成</td><td>检索质量决定效果,模型只是最后一步</td></tr>
<tr><td class="w">超长文本 / 极难推理 / 新知识</td><td><b>云端 API(兜底)</b></td><td>占比 1020%,可脱敏后走云端</td></tr>
</table>
<div class="box"><h4>切换实操(Ollama</h4><ul>
<li>常驻:<code>ollama run qwen35b --keepalive -1</code>-1 = 永不卸载)</li>
<li>按需:27B 特调只在批处理任务前 <code>ollama run qwen27b</code>,处理完自动让出内存</li>
<li>Agent 路由:Hermes Agent 注册"任务分类→模型名"映射,查数走 14B、分析走 35B、特调格式走 27B</li>
<li>不用人肉切换:Ollama 内存不够时会自动驱逐冷模型,配置好 keepalive 就不用管</li>
</ul></div>
<!-- 3 好用配置 -->
<h2><span class="no">3</span>确保"真正好用"的 8 项配置</h2>
<div class="box"><ol>
<li><b>量化别省内存,用 Q5_K_M 起</b>(内存不是瓶颈):Q4→Q5 质量提升明显,256GB/s 带宽下速度损失可接受;Q8 对 30B 级没必要</li>
<li><b>上下文设 32K</b>:128GB 内存完全扛得住,RAG 检索片段+历史对话放得下</li>
<li><b>KV cache 量化开启</b>:再省 20–30% 缓存内存,速度影响小</li>
<li><b>系统提示词写死业务上下文</b>:公司背景+数据口径+输出格式(周报模板)全部写进 system prompt,效果翻倍</li>
<li><b>温度设置</b>:分析/周报类 0.3–0.5(稳定),创意类 0.8+</li>
<li><b>工具调用用 Qwen 原生 function calling</b>:配 Hermes Agent,查库/发消息都走结构化调用,比让模型自由发挥稳得多</li>
<li><b>RAG 分块 5001000 字+保留标题</b>:检索 top-k 先 5–10,人工抽查 10 条检索结果再上模型</li>
<li><b>POC 定基线</b>:先用云端 API 在客户数据上跑出效果样例作为"及格线",本地模型复现达到 90% 即算过——效果好差有基准,不凭感觉</li>
</ol></div>
<!-- 4 替代API能力清单(最重要) -->
<h2><span class="no">4</span>本地模型替代 API 能力清单(最重要)</h2>
<div class="sec-desc">销售型生产企业典型的数据服务场景,逐项标注本地能否替代:<span class="ok">本地可替代</span><span class="part">部分替代</span><span class="no">仍需云端</span></div>
<table>
<tr><th style="width:30%">能力场景</th><th style="width:14%">判定</th><th>说明</th></tr>
<tr><td class="w">经营数据问答(自然语言查数+解释)</td><td><span class="ok">替代</span></td><td>35B MoE 查库+解释完全够用</td></tr>
<tr><td class="w">周报/月报生成(模板化)</td><td><span class="ok">替代</span></td><td>模板+填空式,本地主力场景</td></tr>
<tr><td class="w">异常归因分析(销量暴跌原因)</td><td><span class="ok">替代</span></td><td>关联数据+规则推理,35B 级足够</td></tr>
<tr><td class="w">库存/断码预警生成</td><td><span class="ok">替代</span></td><td>规则触发+文案生成,14B 就够</td></tr>
<tr><td class="w">RAG 文档问答(手册/合同/台账)</td><td><span class="ok">替代</span></td><td>检索质量决定效果,模型是最后一步</td></tr>
<tr><td class="w">非结构化数据提取(订单/单据→表)</td><td><span class="ok">替代</span></td><td>结构化提取是 30B 级强项</td></tr>
<tr><td class="w">长文摘要 / 简报解读</td><td><span class="ok">替代</span></td><td>30B 级摘要质量够用</td></tr>
<tr><td class="w">简单脚本/公式生成(数据分析小工具)</td><td><span class="part">部分</span></td><td>简单脚本行;复杂代码仍建议云端</td></tr>
<tr><td class="w">营销文案/创意写作</td><td><span class="part">部分</span></td><td>初稿行,精品文案差口气</td></tr>
<tr><td class="w">多模态(看图/听语音)</td><td><span class="no">云端</span></td><td>本地方案不含视觉模型;业务需要时单独接 API</td></tr>
<tr><td class="w">超长上下文(&gt;32K 多文档分析)</td><td><span class="no">云端</span></td><td>超出本地上下文时兜底</td></tr>
<tr><td class="w">最新知识(模型知识截止后的事)</td><td><span class="no">云端</span></td><td>本地模型知识有时效,实时信息走 API</td></tr>
<tr><td class="w">极难推理(复杂数学/长链推理)</td><td><span class="no">云端</span></td><td>占比极小,可脱敏后走云端</td></tr>
</table>
<div class="key">🎯 结论:<b>销售型生产企业的数据服务,本地替代率 80–90%</b>。真正必须走云端的(多模态/超长/最新知识/极难推理)业务占比小、且多为可脱敏内容——云端月预算 200 内是够的。</div>
<!-- 5 27B特调策略 -->
<h2><span class="no">5</span>27B 稠密特调策略(别重蹈 7B 覆辙)</h2>
<div class="box"><ol>
<li><b>前期(03 个月)默认不微调</b>35B MoE + 提示词 + RAG 覆盖 90% 场景——微调只在"格式/术语必须绝对稳定"时才有价值</li>
<li><b>什么时候才值得特调</b>:客户跑通 3 个月后,积累了足够的真实问答/报表数据(500–2000 条),且格式要求确实稳不下来——再考虑 QLoRA</li>
<li><b>特调用 27B 稠密、不用 30B MoE</b>:dense 微调后特定任务输出更稳;用 QLoRA(4bit 基础)在 EVO-X2 上也能训,样本量小(数百条)即可</li>
<li><b>特调验收</b>:拿 30 条客户真实场景测试,对比"特调前/后"的输出稳定性与准确率,达标才切换路由</li>
<li><b>特调是增值服务,不是标配</b>:可以作为阶段三之后的"加项"向客户报价(如 5,000–10,000 一次特调服务),而不是白送</li>
</ol></div>
<!-- 6 保障流程 -->
<h2><span class="no">6</span>效果保障流程(客户感知"好用")</h2>
<div class="box"><ol>
<li><b>POC 定基线</b>:客户数据(脱敏)→ 云端 API 生成周报/预警样例 → 老板认可效果</li>
<li><b>本地复现</b>:35B MoE 在本地跑同一任务,达到样例 90% 效果即通过(有基准,不凭感觉)</li>
<li><b>分步放量</b>:先上线"规则明确"任务(预警/查数/周报模板)→ 稳定 2–3 周 → 再开放归因/深度分析</li>
<li><b>效果监控</b>:每周抽查 5 条输出,记录"达标/偏差",连续不达标就调(提示词→RAG→换模型→最后才微调)</li>
<li><b>兜底开关</b>Agent 设"置信度低→自动转云端 API"的开关,本地不行就静默切云端,客户无感</li>
</ol></div>
<footer>本地模型好用落地设计 v1.0 | 配套:硬件与部署实现方案 v1.1、商业闭环运营基板 v1.9 2026-08-04</footer>
</div>
</body>
</html>