7a985dddd5
## 1. PG-only 重构
- 删 app/core/db/connection.py + schema.py (MySQL 路径)
- 新 app/core/db/{orm,models,pg_bootstrap}.py — SQLAlchemy 2.x ORM 一键建表
- 16 张业务表全在 market_data schema,原生 TIMESTAMPTZ / JSONB / Float / TEXT
- requirements.txt 删 PyMySQL 路径,加 psycopg2
## 2. 同步任务扩展(3 个新 task)
- **tick_trade** (mairui hsrl/zbjy):当天逐笔交易,21:00 发布
- **moneyflow** (mairui hsstock/history/transaction):个股资金流,21:30 发布
- **longhubang** (akshare):龙虎榜聚合层 + 席位层(2 张新表)
- 长虎榜放宽 akshare 政策:仅"无替代源 + 烟测通过"场景允许
- data_eastmoney 私有 API 不需要(akshare 烟测通过)
- 3-timer 设计:
- 15:30 market-sync.service (8 base tasks via runall_once)
- 21:05 market-sync-tick.service (tick_trade)
- 21:35 market-sync-moneyflow.service (moneyflow)
- 22:00 market-sync-lhb.service (longhubang,新加)
- bin/systemd/ 新增 tick / moneyflow / lhb 各 1 对 service+timer
- bin/market_sync_*_run.sh wrapper 脚本(不做法定节假日过滤,fail-open)
## 3. stock_code 统一为带 SH/SZ/BJ 前缀
- 历史 bug:stocks.code 用 SH600519,但 kline/moneyflow/tick_trade/kline_5min
/stock_sector_map/industry 6 张表用纯 6 位 600519,跨表 JOIN 全部 0 行
- 新增 to_hermes() 工具:6位 / 9位(mairui `000001.SZ` 格式)→ 统一 SH000001
- 5 个 task 改写:用 to_hermes(code6) 写入 stock_code
- 一次性迁移 6 张表存量 154M 行(CASE WHEN 探测 + 去重 + 加前缀)
- ORM: stock_sector_map.stock_code / industry.code String(6)→String(10)
## 4. Bug 修复
- **share table stock_code 格式**:之前写 6 位不带前缀,与 stocks 不一致
→ 修 task_share_snapshot + 一次性 UPDATE 63,417 行加前缀
- **share_snapshot warning 状态错填 last_error**:
→ 加 mark_sync_warning() 走专用路径,不写 last_failure_at / last_error
- **schedule config lastRun 不同步**:
→ 加 update_job_status_for_dataset(),SyncTask.run() 完成后自动镜像
→ cli/runall 触发的 task 也能更新 schedule config
## 5. mairui UTF-8 编码修复
- 历史 bug:mairui.py:_fetch 用 latin-1 兜底解码,把所有 UTF-8 中文名
double-encoded 写入 stocks.name(如 `歌华有线` 变成 `æ\xad\x8cå\x8d\x8e...`)
- 加 _decode_response():UTF-8 → GBK → latin-1 兜底
- 一次性修复 stocks.name 5,213 行:
- 4,370 行 (encode('latin-1').decode('utf-8') 反向解码)
- 616 行 (含 fullwidth A,宽松 printable 检查)
- 820 行 (mid-character 截断,重新从 mairui 拉)
## 6. 测试
- tests/test_smoke.py: TASKS 10→11, SYNC_DEFINITIONS 10→11
- tests/test_schema_models.py: 16→18 张表,新增 longhubang_daily/seat
- pytest 11/11 passed
## 验证
- 6 张表 0 残留无前缀行
- stocks JOIN kline_stock / kline_5min / moneyflow / tick_trade / stock_sector_map:88-100% 命中
- 5,213 stocks.name 全部正确 UTF-8 中文
- pytest 11/11 passed
113 lines
4.5 KiB
Python
113 lines
4.5 KiB
Python
"""同步任务:市场情绪(market_regime_daily,衍生源)。
|
|
|
|
基于本地 kline_stock 数据聚合:advancers / decliners / turnover / advance_ratio。"""
|
|
from __future__ import annotations
|
|
|
|
from datetime import datetime
|
|
from typing import Any
|
|
|
|
import numpy as np
|
|
import pandas as pd
|
|
from sqlalchemy import text
|
|
|
|
from app.core.db import ops as db_ops
|
|
from app.core.db.orm import engine as pg_engine
|
|
from app.core.sync.base import SyncTask
|
|
from app.core.utils.logging import get_logger
|
|
|
|
logger = get_logger("sync.market_regime")
|
|
|
|
DEFAULT_START = "2018-01-01"
|
|
EXTREME_PANIC_ADV = 0.2
|
|
EXTREME_PANIC_TURN = 1.5
|
|
|
|
|
|
def _is_extreme_panic(row: pd.Series) -> int:
|
|
ar = pd.to_numeric(row.get("advance_ratio"), errors="coerce")
|
|
tr = pd.to_numeric(row.get("turnover_ratio_5d"), errors="coerce")
|
|
if pd.isna(ar) or pd.isna(tr):
|
|
return 0
|
|
return int(ar < EXTREME_PANIC_ADV and tr > EXTREME_PANIC_TURN)
|
|
|
|
|
|
class SyncMarketRegime(SyncTask):
|
|
dataset_id = "market_regime"
|
|
|
|
def _run(self, *, trigger_source: str = "manual", start: str = DEFAULT_START, **kwargs) -> dict[str, Any]:
|
|
end = datetime.now().strftime("%Y-%m-%d")
|
|
self._progress(message=f"构建 market_regime {start} ~ {end}...")
|
|
|
|
# 1. 取所有非退市股票代码
|
|
codes = list(db_ops.iter_stock_codes(active_only=True))
|
|
if not codes:
|
|
return {"status": "error", "message": "stocks 表为空"}
|
|
|
|
# 2. 拉所有 K 线(按股票)— 走 SA text() 走 PG
|
|
sql = text("""
|
|
SELECT
|
|
stock_code,
|
|
trade_date,
|
|
"close",
|
|
volume
|
|
FROM market_data.kline_stock
|
|
WHERE trade_date BETWEEN :start AND :end
|
|
ORDER BY stock_code, trade_date
|
|
""")
|
|
with pg_engine.connect() as conn:
|
|
rows = conn.execute(sql, {"start": start, "end": end}).mappings().all()
|
|
if not rows:
|
|
return {"status": "warning", "message": f"kline_stock 在 {start} ~ {end} 区间无数据"}
|
|
|
|
df = pd.DataFrame(rows)
|
|
df["trade_date"] = pd.to_datetime(df["trade_date"], errors="coerce")
|
|
df["close"] = pd.to_numeric(df["close"], errors="coerce")
|
|
df["volume"] = pd.to_numeric(df["volume"], errors="coerce").fillna(0.0)
|
|
df = df.dropna(subset=["trade_date", "close"]).sort_values(["stock_code", "trade_date"])
|
|
df["prev_close"] = df.groupby("stock_code")["close"].shift(1)
|
|
df = df.dropna(subset=["prev_close"])
|
|
df["advancers"] = (df["close"] > df["prev_close"]).astype(int)
|
|
df["decliners"] = (df["close"] < df["prev_close"]).astype(int)
|
|
df["turnover"] = df["close"] * df["volume"]
|
|
|
|
daily = df.groupby("trade_date", as_index=False)[["advancers", "decliners", "turnover"]].sum()
|
|
total = daily["advancers"] + daily["decliners"]
|
|
daily["advance_ratio"] = np.where(total > 0, daily["advancers"] / total, np.nan)
|
|
daily["turnover_avg_5d"] = daily["turnover"].rolling(5, min_periods=5).mean()
|
|
daily["turnover_ratio_5d"] = np.where(
|
|
daily["turnover_avg_5d"] > 0,
|
|
daily["turnover"] / daily["turnover_avg_5d"],
|
|
np.nan,
|
|
)
|
|
daily["source"] = "local_kline_proxy"
|
|
daily["is_extreme_panic"] = daily.apply(_is_extreme_panic, axis=1)
|
|
daily["trade_date"] = daily["trade_date"].dt.strftime("%Y-%m-%d")
|
|
|
|
rows_out = [
|
|
{
|
|
"trade_date": r["trade_date"],
|
|
"advancers": float(r["advancers"]),
|
|
"decliners": float(r["decliners"]),
|
|
"advance_ratio": float(r["advance_ratio"]) if pd.notna(r["advance_ratio"]) else 0,
|
|
"turnover": float(r["turnover"]),
|
|
"turnover_avg_5d": float(r["turnover_avg_5d"]) if pd.notna(r["turnover_avg_5d"]) else 0,
|
|
"turnover_ratio_5d": float(r["turnover_ratio_5d"]) if pd.notna(r["turnover_ratio_5d"]) else 0,
|
|
"source": r["source"],
|
|
"is_extreme_panic": int(r["is_extreme_panic"]),
|
|
}
|
|
for _, r in daily.iterrows()
|
|
]
|
|
|
|
try:
|
|
db_ops.upsert_market_regime_rows(rows_out)
|
|
except Exception as e:
|
|
return {"status": "error", "message": f"写库失败: {e}"}
|
|
|
|
msg = f"market_regime {len(rows_out)} 天 ({rows_out[0]['trade_date']} ~ {rows_out[-1]['trade_date']})"
|
|
return {
|
|
"status": "ok",
|
|
"message": msg,
|
|
"rows": len(rows_out),
|
|
"date_min": rows_out[0]["trade_date"],
|
|
"date_max": rows_out[-1]["trade_date"],
|
|
}
|