- 删除 5 个过时/残留文档(project_plan/agent_prompt/optimization_plan/report_db_design/deploy/README) - 新建 docs/architecture.md(项目架构:11 包职责+数据模型+配置+产物) - 重写 docs/user-guide.md(CLI 全量+增量/断点续跑+MCP+FAQ) - 重写 README.md(精简入口+文档索引) - 更新 continuation.md(追加本次记录) - 更新 .gitignore(排除 data/* 运行产物)
23 lines
445 B
Python
23 lines
445 B
Python
"""中文新闻正文提取模块 (M2)。
|
|
|
|
公共 API:
|
|
- extract_article: 从 HTML 提取 Article
|
|
- Article: 统一文章模型
|
|
- ExtractError: 提取失败异常
|
|
"""
|
|
|
|
from .models import Article, ExtractError
|
|
from .parser import (
|
|
MIN_CONTENT_LENGTH,
|
|
SOURCE_NAME_MAP,
|
|
extract_article,
|
|
)
|
|
|
|
__all__ = [
|
|
"MIN_CONTENT_LENGTH",
|
|
"SOURCE_NAME_MAP",
|
|
"Article",
|
|
"ExtractError",
|
|
"extract_article",
|
|
]
|