feat: 打通多源新闻记录链路,检索/日报/知识库可见多源 (方案A+B)

- 模型层: EmbeddingResult/SearchResult 新增 sources 字段(主源居首,旧产物兜底)
- M5 run_embedding: events/deduped 产物透传 sources 进 EmbeddingResult
- M6 run_qdrant_ingest: payload 写入 sources(M5 → 回查 M4 → 兜底 [主源])
- vectorstore: 检索读取 payload.sources
- 日报 HTML / CLI search / MCP: 多源显示「财联社 / 新浪 [多源]」
- 新增 scripts/backfill_qdrant_sources.py: 指纹库为权威源,scroll+upsert 回填存量
  (本地模式 set_payload 逐点 0.65s 不可行,改走 ingest 同款快速路径)
- 新增 tests/test_multisource.py 10 个;全量 276 passed
This commit is contained in:
2026-08-22 22:26:10 +08:00
parent 8fa27ad65b
commit 80828310d6
11 changed files with 490 additions and 17 deletions
+5 -1
View File
@@ -63,6 +63,7 @@ def _search(
"title": r.title,
"url": r.url,
"source": r.source_id,
"sources": r.sources if r.sources else ([r.source_id] if r.source_id else []),
"score": round(r.score, 4),
"publish_time": r.publish_time.isoformat() if r.publish_time else None,
"event": {
@@ -100,7 +101,10 @@ def _fmt_results(hits: list[dict[str, Any]], query: str) -> str:
ev.get("sentiment"), ""
)
lines.append(f"### {i}. {h['title']}")
lines.append(f"- 来源: {h['source']} | 相似度: {h['score']} | {sentiment}")
src_list = h.get("sources") or ([h["source"]] if h.get("source") else [])
src_display = " / ".join(src_list)
multi_tag = " [多源]" if len(src_list) > 1 else ""
lines.append(f"- 来源: {src_display}{multi_tag} | 相似度: {h['score']} | {sentiment}")
lines.append(f"- 时间: {h['publish_time'] or '未知'}")
if ev.get("company_names"):
lines.append(f"- 公司: {', '.join(ev['company_names'][:5])}")