Files
qlib/backend/app/infrastructure/persistence/sqlalchemy/repositories/jobs_impl.py
T
Simon 195f5d41f4 perf(backend): 内存优化三项——全市场研究不再占满 8G
1) 数据装配流式+列裁剪:Repository 新增 stream_range_many_columns(只 SELECT
   所需列、SQL 侧转 REAL、yield_per 分批),引擎按 required_columns 取数
   (LocalEngine 仅 close+因子字段),消除 ORM/Decimal 全量物化;
2) 研究 Job 独立子进程执行(job.mode=subprocess):python -m app.cli.run_job
   在子进程内设 RLIMIT_AS 上限,OOM 归档 failed 而非拖垮 API worker;
   子进程异常退出由父进程补记 failed;并发上限 2;
3) 服务启动清理:残留 queued/running Job 标记 failed(防永久 running)。

实测同款全市场回测:uvicorn worker RSS 稳定 ~220MB,任务峰值内存由 4.1GB+
降至 ~470MB,24s 完成并归档(此前 43s 未完成即 OOM)。
新增/更新测试 96 passed,ruff 干净。
2026-09-06 22:12:44 +08:00

73 lines
2.6 KiB
Python

"""Job / Experiment 的 SQLAlchemy 实现(Phase 4)。"""
from __future__ import annotations
from sqlalchemy import select
from sqlalchemy.orm import Session
from app.domain.entities.research import ExperimentRecord, JobRecord
from app.infrastructure.persistence.sqlalchemy.models.jobs import ExperimentModel, JobModel
def _job_to_model(job: JobRecord) -> JobModel:
return JobModel(**job.model_dump())
class SqlAlchemyJobRepository:
def __init__(self, session: Session) -> None:
self._session = session
def create(self, job: JobRecord) -> JobRecord:
self._session.add(_job_to_model(job))
self._session.flush()
return job
def get(self, job_id: str) -> JobRecord | None:
row = self._session.get(JobModel, job_id)
return JobRecord.model_validate(row, from_attributes=True) if row else None
def update(self, job: JobRecord) -> None:
row = self._session.get(JobModel, job.id)
if row is None:
raise KeyError(f"job {job.id} 不存在")
for k, v in job.model_dump().items():
setattr(row, k, v)
def list_recent(self, kind: str | None = None, limit: int = 20) -> list[JobRecord]:
stmt = select(JobModel).order_by(JobModel.created_at.desc()).limit(limit)
if kind:
stmt = stmt.where(JobModel.kind == kind)
return [
JobRecord.model_validate(r, from_attributes=True)
for r in self._session.scalars(stmt).all()
]
def list_by_status(self, status: str, limit: int = 100) -> list[JobRecord]:
rows = self._session.scalars(
select(JobModel)
.where(JobModel.status == status)
.order_by(JobModel.created_at)
.limit(limit)
).all()
return [JobRecord.model_validate(r, from_attributes=True) for r in rows]
class SqlAlchemyExperimentRepository:
def __init__(self, session: Session) -> None:
self._session = session
def save(self, experiment: ExperimentRecord) -> ExperimentRecord:
self._session.add(ExperimentModel(**experiment.model_dump()))
self._session.flush()
return experiment
def get(self, experiment_id: str) -> ExperimentRecord | None:
row = self._session.get(ExperimentModel, experiment_id)
return ExperimentRecord.model_validate(row, from_attributes=True) if row else None
def list_recent(self, limit: int = 50) -> list[ExperimentRecord]:
rows = self._session.scalars(
select(ExperimentModel).order_by(ExperimentModel.created_at.desc()).limit(limit)
).all()
return [ExperimentRecord.model_validate(r, from_attributes=True) for r in rows]