Files
news/extractor/__init__.py
T
simon 65ead54b4f docs: 文档清理与重构 — 统一为 3 个核心文档
- 删除 5 个过时/残留文档(project_plan/agent_prompt/optimization_plan/report_db_design/deploy/README)
- 新建 docs/architecture.md(项目架构:11 包职责+数据模型+配置+产物)
- 重写 docs/user-guide.md(CLI 全量+增量/断点续跑+MCP+FAQ)
- 重写 README.md(精简入口+文档索引)
- 更新 continuation.md(追加本次记录)
- 更新 .gitignore(排除 data/* 运行产物)
2026-08-22 17:10:39 +08:00

23 lines
445 B
Python

"""中文新闻正文提取模块 (M2)。
公共 API:
- extract_article: 从 HTML 提取 Article
- Article: 统一文章模型
- ExtractError: 提取失败异常
"""
from .models import Article, ExtractError
from .parser import (
MIN_CONTENT_LENGTH,
SOURCE_NAME_MAP,
extract_article,
)
__all__ = [
"MIN_CONTENT_LENGTH",
"SOURCE_NAME_MAP",
"Article",
"ExtractError",
"extract_article",
]