Files
market_sync/app/tasks/task_market_regime.py
T
gao 7a985dddd5 refactor: PG-only 迁移 + 龙虎榜/tick/moneyflow 同步 + stock_code 统一 + mairui 编码修复
## 1. PG-only 重构
- 删 app/core/db/connection.py + schema.py (MySQL 路径)
- 新 app/core/db/{orm,models,pg_bootstrap}.py — SQLAlchemy 2.x ORM 一键建表
- 16 张业务表全在 market_data schema,原生 TIMESTAMPTZ / JSONB / Float / TEXT
- requirements.txt 删 PyMySQL 路径,加 psycopg2

## 2. 同步任务扩展(3 个新 task)
- **tick_trade** (mairui hsrl/zbjy):当天逐笔交易,21:00 发布
- **moneyflow** (mairui hsstock/history/transaction):个股资金流,21:30 发布
- **longhubang** (akshare):龙虎榜聚合层 + 席位层(2 张新表)
  - 长虎榜放宽 akshare 政策:仅"无替代源 + 烟测通过"场景允许
  - data_eastmoney 私有 API 不需要(akshare 烟测通过)
- 3-timer 设计:
  - 15:30 market-sync.service (8 base tasks via runall_once)
  - 21:05 market-sync-tick.service (tick_trade)
  - 21:35 market-sync-moneyflow.service (moneyflow)
  - 22:00 market-sync-lhb.service (longhubang,新加)
- bin/systemd/ 新增 tick / moneyflow / lhb 各 1 对 service+timer
- bin/market_sync_*_run.sh wrapper 脚本(不做法定节假日过滤,fail-open)

## 3. stock_code 统一为带 SH/SZ/BJ 前缀
- 历史 bug:stocks.code 用 SH600519,但 kline/moneyflow/tick_trade/kline_5min
  /stock_sector_map/industry 6 张表用纯 6 位 600519,跨表 JOIN 全部 0 行
- 新增 to_hermes() 工具:6位 / 9位(mairui `000001.SZ` 格式)→ 统一 SH000001
- 5 个 task 改写:用 to_hermes(code6) 写入 stock_code
- 一次性迁移 6 张表存量 154M 行(CASE WHEN 探测 + 去重 + 加前缀)
- ORM: stock_sector_map.stock_code / industry.code String(6)→String(10)

## 4. Bug 修复
- **share table stock_code 格式**:之前写 6 位不带前缀,与 stocks 不一致
  → 修 task_share_snapshot + 一次性 UPDATE 63,417 行加前缀
- **share_snapshot warning 状态错填 last_error**:
  → 加 mark_sync_warning() 走专用路径,不写 last_failure_at / last_error
- **schedule config lastRun 不同步**:
  → 加 update_job_status_for_dataset(),SyncTask.run() 完成后自动镜像
  → cli/runall 触发的 task 也能更新 schedule config

## 5. mairui UTF-8 编码修复
- 历史 bug:mairui.py:_fetch 用 latin-1 兜底解码,把所有 UTF-8 中文名
  double-encoded 写入 stocks.name(如 `歌华有线` 变成 `æ\xad\x8cå\x8d\x8e...`)
- 加 _decode_response():UTF-8 → GBK → latin-1 兜底
- 一次性修复 stocks.name 5,213 行:
  - 4,370 行 (encode('latin-1').decode('utf-8') 反向解码)
  - 616 行 (含 fullwidth A,宽松 printable 检查)
  - 820 行 (mid-character 截断,重新从 mairui 拉)

## 6. 测试
- tests/test_smoke.py: TASKS 10→11, SYNC_DEFINITIONS 10→11
- tests/test_schema_models.py: 16→18 张表,新增 longhubang_daily/seat
- pytest 11/11 passed

## 验证
- 6 张表 0 残留无前缀行
- stocks JOIN kline_stock / kline_5min / moneyflow / tick_trade / stock_sector_map:88-100% 命中
- 5,213 stocks.name 全部正确 UTF-8 中文
- pytest 11/11 passed
2026-07-01 22:00:58 +08:00

113 lines
4.5 KiB
Python

"""同步任务:市场情绪(market_regime_daily,衍生源)。
基于本地 kline_stock 数据聚合:advancers / decliners / turnover / advance_ratio。"""
from __future__ import annotations
from datetime import datetime
from typing import Any
import numpy as np
import pandas as pd
from sqlalchemy import text
from app.core.db import ops as db_ops
from app.core.db.orm import engine as pg_engine
from app.core.sync.base import SyncTask
from app.core.utils.logging import get_logger
logger = get_logger("sync.market_regime")
DEFAULT_START = "2018-01-01"
EXTREME_PANIC_ADV = 0.2
EXTREME_PANIC_TURN = 1.5
def _is_extreme_panic(row: pd.Series) -> int:
ar = pd.to_numeric(row.get("advance_ratio"), errors="coerce")
tr = pd.to_numeric(row.get("turnover_ratio_5d"), errors="coerce")
if pd.isna(ar) or pd.isna(tr):
return 0
return int(ar < EXTREME_PANIC_ADV and tr > EXTREME_PANIC_TURN)
class SyncMarketRegime(SyncTask):
dataset_id = "market_regime"
def _run(self, *, trigger_source: str = "manual", start: str = DEFAULT_START, **kwargs) -> dict[str, Any]:
end = datetime.now().strftime("%Y-%m-%d")
self._progress(message=f"构建 market_regime {start} ~ {end}...")
# 1. 取所有非退市股票代码
codes = list(db_ops.iter_stock_codes(active_only=True))
if not codes:
return {"status": "error", "message": "stocks 表为空"}
# 2. 拉所有 K 线(按股票)— 走 SA text() 走 PG
sql = text("""
SELECT
stock_code,
trade_date,
"close",
volume
FROM market_data.kline_stock
WHERE trade_date BETWEEN :start AND :end
ORDER BY stock_code, trade_date
""")
with pg_engine.connect() as conn:
rows = conn.execute(sql, {"start": start, "end": end}).mappings().all()
if not rows:
return {"status": "warning", "message": f"kline_stock 在 {start} ~ {end} 区间无数据"}
df = pd.DataFrame(rows)
df["trade_date"] = pd.to_datetime(df["trade_date"], errors="coerce")
df["close"] = pd.to_numeric(df["close"], errors="coerce")
df["volume"] = pd.to_numeric(df["volume"], errors="coerce").fillna(0.0)
df = df.dropna(subset=["trade_date", "close"]).sort_values(["stock_code", "trade_date"])
df["prev_close"] = df.groupby("stock_code")["close"].shift(1)
df = df.dropna(subset=["prev_close"])
df["advancers"] = (df["close"] > df["prev_close"]).astype(int)
df["decliners"] = (df["close"] < df["prev_close"]).astype(int)
df["turnover"] = df["close"] * df["volume"]
daily = df.groupby("trade_date", as_index=False)[["advancers", "decliners", "turnover"]].sum()
total = daily["advancers"] + daily["decliners"]
daily["advance_ratio"] = np.where(total > 0, daily["advancers"] / total, np.nan)
daily["turnover_avg_5d"] = daily["turnover"].rolling(5, min_periods=5).mean()
daily["turnover_ratio_5d"] = np.where(
daily["turnover_avg_5d"] > 0,
daily["turnover"] / daily["turnover_avg_5d"],
np.nan,
)
daily["source"] = "local_kline_proxy"
daily["is_extreme_panic"] = daily.apply(_is_extreme_panic, axis=1)
daily["trade_date"] = daily["trade_date"].dt.strftime("%Y-%m-%d")
rows_out = [
{
"trade_date": r["trade_date"],
"advancers": float(r["advancers"]),
"decliners": float(r["decliners"]),
"advance_ratio": float(r["advance_ratio"]) if pd.notna(r["advance_ratio"]) else 0,
"turnover": float(r["turnover"]),
"turnover_avg_5d": float(r["turnover_avg_5d"]) if pd.notna(r["turnover_avg_5d"]) else 0,
"turnover_ratio_5d": float(r["turnover_ratio_5d"]) if pd.notna(r["turnover_ratio_5d"]) else 0,
"source": r["source"],
"is_extreme_panic": int(r["is_extreme_panic"]),
}
for _, r in daily.iterrows()
]
try:
db_ops.upsert_market_regime_rows(rows_out)
except Exception as e:
return {"status": "error", "message": f"写库失败: {e}"}
msg = f"market_regime {len(rows_out)} 天 ({rows_out[0]['trade_date']} ~ {rows_out[-1]['trade_date']})"
return {
"status": "ok",
"message": msg,
"rows": len(rows_out),
"date_min": rows_out[0]["trade_date"],
"date_max": rows_out[-1]["trade_date"],
}