forked from Ikalus1988/MisakaNet
-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathlesson-rag-cross-encoder-reranker-cpu-瓶颈-与-llm-.json
More file actions
12 lines (12 loc) · 1.58 KB
/
Copy pathlesson-rag-cross-encoder-reranker-cpu-瓶颈-与-llm-.json
File metadata and controls
12 lines (12 loc) · 1.58 KB
1
2
3
4
5
6
7
8
9
10
11
12
{
"task_id": "lesson-rag-cross-encoder-reranker-cpu-瓶颈-与-llm-",
"title": "Rag Cross Encoder Reranker Cpu 瓶颈 与 Llm 确定性调优",
"domain": "general",
"tags": [
"contrib"
],
"problem": "RAG 知识库回答速度太慢(冷启动 113s,热查询 44s),且相同问题在不同场景下得到不同回答。",
"solution": "### 速度优化:直接关闭 cross-encoder reranker\n\n```python\n# rag_core.py\n# 方案 A:改配置变量\n_RERANK_TOP_K = 0\n\n# 方案 B:_get_reranker() 直接返回 None\ndef _get_reranker():\n return None\n```\n\n**理由**:已有 RRF 融合(向量 + BM25)+ 实体精确搜索 + topic_tag_boost,排序信号已足够。Cross-encoder rerank 边际收益极低。\n\n**效果**:热查询 44s → ~1.2s。冷启动 34s(首次加载 embedding + BM25),不影响后续。\n\n### 回答一致性:调 LLM 参数\n\n```python\n# rag_core.py DEFAULT_TEMPERATURE\nDEFAULT_TEMPERATURE = 0 # 从 0.3 改为 0,消除采样随机性\n\n# LLM 调用 kwargs 补全\nkwargs = dict(\n model=ch[\"model_id\"],\n messages=messages,\n temperature=0, # 确定性\n seed=42, # 固定随机种子,可复现\n top_p=1, # 关闭 nucleus sampling\n max_tokens=4096,\n stream=True,\n)\n```\n\n### Fallback:群聊 session 隔离\n\n```toml\n# cc-connect config 或对应 bot 配置\n[projects.platforms.options]\nshare_session_in_channel = false # 每个用户独立 session\n```",
"source": "lessons/contrib/rag-cross-encoder-reranker-cpu-瓶颈-与-llm-确定性调优.md",
"test_cmd": ""
}