Initial: knowledge base

This commit is contained in:
2026-08-05 17:25:15 +08:00
commit a5632c517e
15 changed files with 2471 additions and 0 deletions
+140
View File
@@ -0,0 +1,140 @@
<!DOCTYPE html>
<html lang="zh-CN">
<head>
<meta charset="UTF-8">
<meta name="viewport" content="width=device-width, initial-scale=1.0">
<title>本地模型好用落地设计 v1.0EVO-X2 128GB 平台)</title>
<style>
:root{--ink:#1A2433;--muted:#6B7A8F;--navy:#13315C;--blue:#2E93F7;--orange:#FF8A3D;--bg:#F4F7FB;--card:#FFFFFF;--line:#E3EAF2;--green:#2E9E6B;--red:#D9534F;}
*{box-sizing:border-box;margin:0;padding:0;}
body{font-family:"Microsoft YaHei","PingFang SC",sans-serif;background:var(--bg);color:var(--ink);line-height:1.65;font-size:14px;}
.wrap{max-width:1000px;margin:0 auto;padding:32px 24px 80px;}
.hero{background:linear-gradient(135deg,#0B2545 0%,#13315C 60%,#1E6FB8 100%);color:#fff;border-radius:14px;padding:36px 44px;margin-bottom:26px;}
.hero .tag{display:inline-block;background:rgba(46,147,247,.25);border:1px solid rgba(46,147,247,.5);color:#BBD6F2;padding:3px 12px;border-radius:20px;font-size:12px;margin-bottom:12px;}
.hero h1{font-size:25px;}
.hero .sub{color:#BBD6F2;margin-top:8px;font-size:14px;}
.hero .params{margin-top:18px;display:flex;flex-wrap:wrap;gap:10px;}
.hero .params span{background:rgba(255,255,255,.08);border:1px solid rgba(255,255,255,.16);padding:6px 14px;border-radius:8px;font-size:13px;}
h2{font-size:20px;color:var(--navy);margin:42px 0 6px;display:flex;align-items:center;gap:10px;}
h2 .no{background:var(--navy);color:#fff;width:30px;height:30px;border-radius:8px;display:inline-flex;align-items:center;justify-content:center;font-size:15px;flex:0 0 auto;}
.sec-desc{color:var(--muted);margin-bottom:16px;font-size:13px;}
table{width:100%;border-collapse:collapse;background:var(--card);border-radius:12px;overflow:hidden;border:1px solid var(--line);font-size:13px;margin-bottom:14px;}
th{background:var(--navy);color:#fff;padding:9px 12px;text-align:left;font-weight:600;}
td{padding:9px 12px;border-top:1px solid var(--line);vertical-align:top;}
tr:nth-child(even) td{background:#FAFCFE;}
td .w{font-weight:600;color:var(--navy);}
.box{background:var(--card);border:1px solid var(--line);border-radius:12px;padding:16px 20px;margin-bottom:14px;}
.box h4{color:var(--navy);font-size:15px;margin-bottom:8px;}
.box ul,.box ol{padding-left:20px;}
.box li{font-size:13px;padding:3px 0;}
.key{background:#F2F8FE;border:1px dashed var(--blue);border-radius:10px;padding:12px 16px;margin:12px 0;font-size:13px;}
.key b{color:var(--navy);}
.ok{display:inline-block;font-size:11px;font-weight:600;color:#fff;background:var(--green);border-radius:8px;padding:0 7px;margin-right:4px;}
.no{display:inline-block;font-size:11px;font-weight:600;color:#fff;background:var(--red);border-radius:8px;padding:0 7px;margin-right:4px;}
.part{display:inline-block;font-size:11px;font-weight:600;color:#fff;background:var(--orange);border-radius:8px;padding:0 7px;margin-right:4px;}
footer{margin-top:44px;text-align:center;color:var(--muted);font-size:12px;}
</style>
</head>
<body>
<div class="wrap">
<div class="hero">
<span class="tag">技术落地设计 · 在 EVO-X2 128GB 硬件上确保"真正好用" · v1.0</span>
<h1>本地模型好用落地设计</h1>
<div class="sub">核心问题:35B MoE 与 27B 稠密特调"用哪个加载哪个",如何确保客户真正用起来、能替代多少 API 能力。答案:EVO-X2 的内存预算足够同时驻留主力模型,按任务路由即可;销售型生产企业 80–90% 的数据服务场景本地可替代。</div>
<div class="params">
<span>平台:<b>EVO-X2 128GB</b>96GB 可分 GPU / 256GB/s</span>
<span>策略:<b>多模型同时驻留 + 按任务路由</b></span>
<span>替代率:<b>本地覆盖 80–90%,云端只兜底 10–20%</b></span>
</div>
</div>
<!-- 1 内存预算 -->
<h2><span class="no">1</span>内存预算:多模型同时驻留可行</h2>
<div class="sec-desc">EVO-X2 128GB 统一内存、可分配 96GB 给 GPU——这决定了你<b>不用"加载一个卸一个"</b>,主力模型可以常驻,切换近乎无感。Ollama 原生支持多模型常驻(keep_alive)。</div>
<table>
<tr><th>模型</th><th>量化</th><th>占用</th><th>用途</th><th>驻留策略</th></tr>
<tr><td class="w">Qwen3.6-35B-A3BMoE,激活 3B</td><td>Q5_K_M</td><td>≈25GB</td><td>通用分析:周报/归因/问答/深度分析(<b>主力</b></td><td><b>常驻</b>keep_alive=-1</td></tr>
<tr><td class="w">Qwen 27B 稠密(特调版)</td><td>Q4_K_M</td><td>≈20GB</td><td>特调业务场景:固定格式输出、行业术语(<b>备用主力</b></td><td>按需加载(业务批处理时)</td></tr>
<tr><td class="w">Qwen3-14B</td><td>Q5_K_M</td><td>≈10GB</td><td>规则任务:查数、工具调用、格式提取(快)</td><td><b>常驻</b></td></tr>
<tr><td class="w">bge-m3(嵌入)</td><td>fp16</td><td>≈2GB</td><td>RAG 向量化</td><td><b>常驻</b></td></tr>
<tr><td class="w">KV cache(32K 上下文 × 常驻模型)</td><td></td><td>≈812GB</td><td>长上下文缓存</td><td></td></tr>
</table>
<div class="key">✅ 合计常驻约 4549GB35B MoE + 14B + 嵌入 + KV),加 27B 特调也仅约 65–69GB —— 远小于 96GB 可用额度,<b>还剩 30GB 余量</b>。结论:不用做"加载卸载"的取舍,四个模型可以同时住在内存里,Agent 按任务路由即可。</div>
<!-- 2 用哪个加载哪个 -->
<h2><span class="no">2</span>"用哪个加载哪个":模型路由规则</h2>
<div class="sec-desc">MoE 和稠密特调不是二选一,是<b>分工</b>。默认 MoE 干活,特调只在特定场景顶上。</div>
<table>
<tr><th>任务类型</th><th>用哪个</th><th>为什么</th></tr>
<tr><td class="w">经营分析 / 周报 / 归因 / 深度问答</td><td><b>35B MoE(常驻)</b></td><td>通用推理强、速度快(25–35 Token/s),覆盖 80% 场景</td></tr>
<tr><td class="w">固定格式输出(特定报表/单据)</td><td><b>27B 稠密特调(按需)</b></td><td>微调后输出格式绝对稳定、术语准确——但只在真的需要时才上</td></tr>
<tr><td class="w">查数 / 工具调用 / 简短提取</td><td><b>14B(常驻)</b></td><td>快、省,杀鸡不用牛刀</td></tr>
<tr><td class="w">文档检索问答(RAG</td><td>bge-m3 检索 + 14B/35B 生成</td><td>检索质量决定效果,模型只是最后一步</td></tr>
<tr><td class="w">超长文本 / 极难推理 / 新知识</td><td><b>云端 API(兜底)</b></td><td>占比 1020%,可脱敏后走云端</td></tr>
</table>
<div class="box"><h4>切换实操(Ollama</h4><ul>
<li>常驻:<code>ollama run qwen35b --keepalive -1</code>-1 = 永不卸载)</li>
<li>按需:27B 特调只在批处理任务前 <code>ollama run qwen27b</code>,处理完自动让出内存</li>
<li>Agent 路由:Hermes Agent 注册"任务分类→模型名"映射,查数走 14B、分析走 35B、特调格式走 27B</li>
<li>不用人肉切换:Ollama 内存不够时会自动驱逐冷模型,配置好 keepalive 就不用管</li>
</ul></div>
<!-- 3 好用配置 -->
<h2><span class="no">3</span>确保"真正好用"的 8 项配置</h2>
<div class="box"><ol>
<li><b>量化别省内存,用 Q5_K_M 起</b>(内存不是瓶颈):Q4→Q5 质量提升明显,256GB/s 带宽下速度损失可接受;Q8 对 30B 级没必要</li>
<li><b>上下文设 32K</b>:128GB 内存完全扛得住,RAG 检索片段+历史对话放得下</li>
<li><b>KV cache 量化开启</b>:再省 20–30% 缓存内存,速度影响小</li>
<li><b>系统提示词写死业务上下文</b>:公司背景+数据口径+输出格式(周报模板)全部写进 system prompt,效果翻倍</li>
<li><b>温度设置</b>:分析/周报类 0.3–0.5(稳定),创意类 0.8+</li>
<li><b>工具调用用 Qwen 原生 function calling</b>:配 Hermes Agent,查库/发消息都走结构化调用,比让模型自由发挥稳得多</li>
<li><b>RAG 分块 5001000 字+保留标题</b>:检索 top-k 先 5–10,人工抽查 10 条检索结果再上模型</li>
<li><b>POC 定基线</b>:先用云端 API 在客户数据上跑出效果样例作为"及格线",本地模型复现达到 90% 即算过——效果好差有基准,不凭感觉</li>
</ol></div>
<!-- 4 替代API能力清单(最重要) -->
<h2><span class="no">4</span>本地模型替代 API 能力清单(最重要)</h2>
<div class="sec-desc">销售型生产企业典型的数据服务场景,逐项标注本地能否替代:<span class="ok">本地可替代</span><span class="part">部分替代</span><span class="no">仍需云端</span></div>
<table>
<tr><th style="width:30%">能力场景</th><th style="width:14%">判定</th><th>说明</th></tr>
<tr><td class="w">经营数据问答(自然语言查数+解释)</td><td><span class="ok">替代</span></td><td>35B MoE 查库+解释完全够用</td></tr>
<tr><td class="w">周报/月报生成(模板化)</td><td><span class="ok">替代</span></td><td>模板+填空式,本地主力场景</td></tr>
<tr><td class="w">异常归因分析(销量暴跌原因)</td><td><span class="ok">替代</span></td><td>关联数据+规则推理,35B 级足够</td></tr>
<tr><td class="w">库存/断码预警生成</td><td><span class="ok">替代</span></td><td>规则触发+文案生成,14B 就够</td></tr>
<tr><td class="w">RAG 文档问答(手册/合同/台账)</td><td><span class="ok">替代</span></td><td>检索质量决定效果,模型是最后一步</td></tr>
<tr><td class="w">非结构化数据提取(订单/单据→表)</td><td><span class="ok">替代</span></td><td>结构化提取是 30B 级强项</td></tr>
<tr><td class="w">长文摘要 / 简报解读</td><td><span class="ok">替代</span></td><td>30B 级摘要质量够用</td></tr>
<tr><td class="w">简单脚本/公式生成(数据分析小工具)</td><td><span class="part">部分</span></td><td>简单脚本行;复杂代码仍建议云端</td></tr>
<tr><td class="w">营销文案/创意写作</td><td><span class="part">部分</span></td><td>初稿行,精品文案差口气</td></tr>
<tr><td class="w">多模态(看图/听语音)</td><td><span class="no">云端</span></td><td>本地方案不含视觉模型;业务需要时单独接 API</td></tr>
<tr><td class="w">超长上下文(&gt;32K 多文档分析)</td><td><span class="no">云端</span></td><td>超出本地上下文时兜底</td></tr>
<tr><td class="w">最新知识(模型知识截止后的事)</td><td><span class="no">云端</span></td><td>本地模型知识有时效,实时信息走 API</td></tr>
<tr><td class="w">极难推理(复杂数学/长链推理)</td><td><span class="no">云端</span></td><td>占比极小,可脱敏后走云端</td></tr>
</table>
<div class="key">🎯 结论:<b>销售型生产企业的数据服务,本地替代率 80–90%</b>。真正必须走云端的(多模态/超长/最新知识/极难推理)业务占比小、且多为可脱敏内容——云端月预算 200 内是够的。</div>
<!-- 5 27B特调策略 -->
<h2><span class="no">5</span>27B 稠密特调策略(别重蹈 7B 覆辙)</h2>
<div class="box"><ol>
<li><b>前期(03 个月)默认不微调</b>35B MoE + 提示词 + RAG 覆盖 90% 场景——微调只在"格式/术语必须绝对稳定"时才有价值</li>
<li><b>什么时候才值得特调</b>:客户跑通 3 个月后,积累了足够的真实问答/报表数据(500–2000 条),且格式要求确实稳不下来——再考虑 QLoRA</li>
<li><b>特调用 27B 稠密、不用 30B MoE</b>:dense 微调后特定任务输出更稳;用 QLoRA(4bit 基础)在 EVO-X2 上也能训,样本量小(数百条)即可</li>
<li><b>特调验收</b>:拿 30 条客户真实场景测试,对比"特调前/后"的输出稳定性与准确率,达标才切换路由</li>
<li><b>特调是增值服务,不是标配</b>:可以作为阶段三之后的"加项"向客户报价(如 5,000–10,000 一次特调服务),而不是白送</li>
</ol></div>
<!-- 6 保障流程 -->
<h2><span class="no">6</span>效果保障流程(客户感知"好用")</h2>
<div class="box"><ol>
<li><b>POC 定基线</b>:客户数据(脱敏)→ 云端 API 生成周报/预警样例 → 老板认可效果</li>
<li><b>本地复现</b>:35B MoE 在本地跑同一任务,达到样例 90% 效果即通过(有基准,不凭感觉)</li>
<li><b>分步放量</b>:先上线"规则明确"任务(预警/查数/周报模板)→ 稳定 2–3 周 → 再开放归因/深度分析</li>
<li><b>效果监控</b>:每周抽查 5 条输出,记录"达标/偏差",连续不达标就调(提示词→RAG→换模型→最后才微调)</li>
<li><b>兜底开关</b>Agent 设"置信度低→自动转云端 API"的开关,本地不行就静默切云端,客户无感</li>
</ol></div>
<footer>本地模型好用落地设计 v1.0 | 配套:硬件与部署实现方案 v1.1、商业闭环运营基板 v1.9 2026-08-04</footer>
</div>
</body>
</html>