feat: 大模型使用场景化配置与去重多源记录

- 新增 configs/llm_models.yaml: 4 个场景(event_extraction/daily_report/stock_report/embedding)
  可独立配置 provider/model/api_key_env/base_url_env/temperature 等,含用途与模型要求说明
- 新增 configs/loader.py: YAML 场景加载器(优先级: CLI 参数 > YAML > .env > 内置默认)
- llm/client.py: load_llm_config 支持 scene 参数,LLMConfig 增加 max_attempts
- embedding/factory+remote+local: provider/model/batch_limit 支持场景覆盖
- scheduler/reporter+stock_reporter: 日报/个股摘要接入场景配置
- dedup: Fingerprint.source_ids 多源记录 + 旧库自动迁移 + DedupResult 多源字段
- scripts/run_dedup: uniques JSON 的 sources 字段 + data/deduped/{day}/sources.json 汇总
- scripts/run_event_extraction: 接入 event_extraction 场景
- 补充测试: 场景优先级/零值、多源合并、旧库迁移、embedding 场景覆盖
This commit is contained in:
2026-08-12 07:57:10 +08:00
parent 0c032196d2
commit 3c65701449
21 changed files with 886 additions and 80 deletions
+1
View File
@@ -0,0 +1 @@
"""configs 配置包:提供 configs/*.yaml 的加载能力。"""
+133
View File
@@ -0,0 +1,133 @@
# =============================================================================
# configs/llm_models.yaml —— 大模型使用场景配置
#
# 本文件集中配置本项目所有调用 AI 大模型的地方,每个场景可独立指定
# provider(厂商/服务类型)与 model(模型名),互不影响、单独切换。
#
# ── 配置优先级(从高到低)──────────────────────────────────────────────────────
# 1. 代码 / 命令行显式参数(如 --provider qwen --model qwen-plus)
# 2. 本文件 scenes.<场景>.xxx
# 3. 环境变量 / .env(LLM_PROVIDER、DEEPSEEK_MODEL 等,向后兼容)
# 4. 代码内置默认值
#
# ── 规则 ─────────────────────────────────────────────────────────────────────
# · provider 取值:
# 对话大模型: deepseek | qwen(OpenAI 兼容 chat 接口)
# 向量嵌入模型: dashscope | local-bge(仅 embedding 场景)
# · model 留空 = 该场景不覆盖模型 → 回退 .env(如 DEEPSEEK_MODEL / QWEN_MODEL /
# LLM_MODEL);若全部缺失则直接报错,绝不静默使用内置默认模型。
# · api_key_env / base_url_env 为可选字段,填写存放 API Key / 服务地址的
# 环境变量名;API Key 一律放 .env,禁止写入本文件(安全规范)。
# · 修改后无需重启常驻服务即可生效(每次调用重新读取;如需热更新缓存可重启)。
# =============================================================================
# ---- 全局默认参数(各场景可覆盖;低于 .env,高于代码内置默认)----
defaults:
timeout_sec: 60
temperature: 0.1
scenes:
# ------------------------------------------------------------------------- #
# 场景 1: 投资事件抽取(M4 核心)
# ------------------------------------------------------------------------- #
# 用途:对每条唯一新闻调用大模型,抽取结构化投资事件
# (stock_codes / company_names / industries / sentiment / importance /
# event_type / summary),输出严格 JSON,经 Pydantic 校验后落盘。
# 调用方: llm/extractor.py、scripts/run_event_extraction.py、
# scheduler/pipeline.py 的 llm 步骤。
# 频率:每日数百~数千篇;建议异步并发(--concurrency,默认 3)。
# 使用方式:
# uv run a-share events # 读本场景配置
# uv run a-share events --provider qwen # CLI 临时覆盖 provider
# uv run a-share events --model qwen-max # CLI 临时覆盖模型
# 对模型的要求:
# · 必须支持 OpenAI 兼容 chat/completions 接口;
# · 必须支持 JSON 结构化输出(response_format=json_object,硬性要求);
# · 上下文窗口 ≥ 16K tokens(单篇正文最多截断到 8000 字符);
# · 中文理解能力强,能区分 A 股事件类型(业绩预告/投资并购/宏观政策等 23 类);
# · 低 temperature(0.1)保证抽取稳定,避免字段抖动。
# 建议模型: deepseek-v4-flash(生产实测) / deepseek-chat / qwen-plus / qwen-max
event_extraction:
provider: # 建议 deepseek | qwen;留空则回退 .env 的 LLM_PROVIDER
model: # 留空则回退 .env(DEEPSEEK_MODEL → LLM_MODEL)
api_key_env: # 例如: DEEPSEEK_API_KEY / QWEN_API_KEY / DASHSCOPE_API_KEY
base_url_env: # 例如: DEEPSEEK_BASE_URL / QWEN_BASE_URL
temperature: 0.1
timeout_sec: 60
max_attempts: 3 # 单篇解析失败的最大重试次数
# ------------------------------------------------------------------------- #
# 场景 2: 日报 AI 摘要
# ------------------------------------------------------------------------- #
# 用途:每天汇总「新闻联播 + 过去 24h 高重要度新闻 + 近 N 日重要公告/调研」,
# 生成 500 字以内的日报要点摘要,渲染进 HTML 日报。
# 调用方: scheduler/reporter.py 的 _generate_ai_summary → _llm_summarize。
# 频率:每天 1 次(07:00 定时任务,与 pipeline 同批)。
# 使用方式:无需手动触发,定时任务自动执行;失败自动降级(日报留空,不影响入库)。
# 对模型的要求:
# · OpenAI 兼容 chat 接口(不需要 JSON 输出);
# · 输出长度 ≥ 1500 tokens(max_tokens=1500,输出超长会被截断并记 WARNING);
# · 中文摘要能力强、要点化输出稳定(每条一行,以 "- " 开头);
# · 上下文窗口 ≥ 8K tokens(素材按 3000 字符/块分块,多块先分段再合并);
# · temperature 0.3 左右,兼顾稳定与表达;网络失败按指数退避重试 3 次。
# · 输出长度需求:分段摘要约 800 tokens、合并摘要约 1500 tokens(代码内置,
# 不在本文件配置),模型应能稳定输出 1500+ tokens 的中文要点。
# 建议模型: deepseek-v4-flash(生产实测) / deepseek-chat / qwen-plus
daily_report:
provider: # 建议 deepseek | qwen;留空则回退 .env 的 LLM_PROVIDER
model:
api_key_env:
base_url_env:
temperature: 0.3
timeout_sec: 60
# ------------------------------------------------------------------------- #
# 场景 3: 个股 AI 要点分析
# ------------------------------------------------------------------------- #
# 用途:针对观察清单中的单只股票,汇总其近期公告/调研/新闻/互动问答,
# 生成 5-8 条要点分析,渲染进个股日报。
# 调用方: scheduler/stock_reporter.py 的 _generate_ai_summary。
# 频率:每交易日 1 次(07:30),对 watchlist 内每只股票各调用一次。
# 使用方式:定时任务自动执行;单次失败不影响其他股票(该股显示"AI 摘要暂不可用")。
# 对模型的要求:
# · OpenAI 兼容 chat 接口(不需要 JSON 输出);
# · 输出长度 ≥ 500 tokens(max_tokens=500);
# · 中文要点分析能力,输入素材最多 3500 字符(公告+调研+新闻+互动问答);
# · temperature 0.3 左右。
# · 输出长度需求:约 500 tokens(代码内置,不在本文件配置)。
# 建议模型: deepseek-v4-flash(生产实测) / deepseek-chat / qwen-plus
stock_report:
provider: # 建议 deepseek | qwen;留空则回退 .env 的 LLM_PROVIDER
model:
api_key_env:
base_url_env:
temperature: 0.3
timeout_sec: 60
# ------------------------------------------------------------------------- #
# 场景 4: 文本向量化 Embedding(新闻/事件入库 + 语义检索)
# ------------------------------------------------------------------------- #
# 用途:把新闻正文/事件文本转为向量,写入 Qdrant 知识库;检索时对查询文本
# 同样向量化后做相似度搜索。M5 入库、MCP 检索、pipeline 均复用本场景。
# 调用方: embedding/remote.py(远程)、embedding/local.py(本地)、
# embedding/factory.py、scripts/run_embedding.py、mcp_server/tools.py。
# 使用方式:
# uv run a-share embed # 读本场景配置
# uv run a-share embed --provider local-bge # 临时切换本地模型
# 注意:这是「嵌入模型」而非对话大模型,二选一:
# · provider: dashscope → 阿里百炼 text-embedding-v3(远程,需 API key);
# · provider: local-bge → 本地 BGE-M3(离线,需 uv sync --extra
# local-embedding,首次加载约 2.3GB)。
# 对模型的要求:
# · 输出固定维度向量(本项目默认 1024 维,DashScope 与本地 BGE-M3 兼容);
# · 中文语义匹配效果好,支持 batch 输入(单批上限 batch_limit 条);
# · 远程需 OpenAI 兼容 embeddings 接口。
# 建议模型: text-embedding-v3(远程) / BAAI/bge-m3(本地)
embedding:
provider: # 建议 dashscope | local-bge;留空则回退 .env 的 EMBEDDING_PROVIDER
model: # 留空则回退 .env(DASHSCOPE_EMBEDDING_MODEL / LOCAL_EMBEDDING_MODEL)
api_key_env: # 例如: DASHSCOPE_EMBEDDING_API_KEY / DASHSCOPE_API_KEY
base_url_env: # 例如: DASHSCOPE_EMBEDDING_BASE_URL
timeout_sec: 60
max_attempts: 3 # 单批请求失败重试次数
batch_limit: 10 # 单批最大条数(百炼实测上限 10,勿调大)
+69
View File
@@ -0,0 +1,69 @@
"""configs/ 目录下 YAML 配置加载器。
目前支持加载 configs/llm_models.yaml 的场景配置(scenes.<scene>)。
配置优先级(从高到低):
1. 代码 / 命令行显式参数(如 --provider qwen --model qwen-plus)
2. 本文件 YAML 场景配置(scenes.<scene>)
3. 环境变量 / .env(LLM_PROVIDER、DEEPSEEK_MODEL 等,向后兼容)
4. 代码内置默认值
说明:API Key 一律放 .env,本文件只保存环境变量名(api_key_env),禁止写密钥。
"""
from __future__ import annotations
from functools import lru_cache
from pathlib import Path
from loguru import logger
DEFAULT_CONFIG_PATH = Path("configs/llm_models.yaml")
@lru_cache(maxsize=8)
def _load_yaml(path: Path) -> dict:
"""读取 YAML 文件为 dict;文件缺失或解析失败返回空 dict(走兜底配置)。"""
if not path.is_file():
logger.debug("配置文件不存在,使用内置/环境变量兜底: {}", path)
return {}
try:
import yaml
data = yaml.safe_load(path.read_text(encoding="utf-8")) or {}
except Exception as e: # noqa: BLE001 - YAML 语法错误等
logger.error("解析 {} 失败: {}", path, e)
return {}
return data if isinstance(data, dict) else {}
def load_scene_config(scene: str) -> dict:
"""读取 llm_models.yaml 中 scenes.<scene> 的配置 dict。
场景不存在或未配置时返回空 dict(调用方回退 .env / 内置默认)。
scene 为空字符串同样返回空 dict。
"""
if not scene:
return {}
data = _load_yaml(DEFAULT_CONFIG_PATH)
scenes = data.get("scenes") or {}
cfg = scenes.get(scene)
if cfg is None:
logger.debug("llm_models.yaml 未配置场景 {!r},使用 .env 兜底", scene)
return {}
if not isinstance(cfg, dict):
logger.warning("llm_models.yaml 场景 {!r} 应为 map,已忽略", scene)
return {}
return cfg
def load_defaults() -> dict:
"""读取 llm_models.yaml 顶层 defaults(全局默认参数)。"""
data = _load_yaml(DEFAULT_CONFIG_PATH)
d = data.get("defaults") or {}
return d if isinstance(d, dict) else {}
def clear_cache() -> None:
"""清空 YAML 缓存(测试或热更新配置时使用)。"""
_load_yaml.cache_clear()