refactor: PG-only 迁移 + 龙虎榜/tick/moneyflow 同步 + stock_code 统一 + mairui 编码修复
## 1. PG-only 重构
- 删 app/core/db/connection.py + schema.py (MySQL 路径)
- 新 app/core/db/{orm,models,pg_bootstrap}.py — SQLAlchemy 2.x ORM 一键建表
- 16 张业务表全在 market_data schema,原生 TIMESTAMPTZ / JSONB / Float / TEXT
- requirements.txt 删 PyMySQL 路径,加 psycopg2
## 2. 同步任务扩展(3 个新 task)
- **tick_trade** (mairui hsrl/zbjy):当天逐笔交易,21:00 发布
- **moneyflow** (mairui hsstock/history/transaction):个股资金流,21:30 发布
- **longhubang** (akshare):龙虎榜聚合层 + 席位层(2 张新表)
- 长虎榜放宽 akshare 政策:仅"无替代源 + 烟测通过"场景允许
- data_eastmoney 私有 API 不需要(akshare 烟测通过)
- 3-timer 设计:
- 15:30 market-sync.service (8 base tasks via runall_once)
- 21:05 market-sync-tick.service (tick_trade)
- 21:35 market-sync-moneyflow.service (moneyflow)
- 22:00 market-sync-lhb.service (longhubang,新加)
- bin/systemd/ 新增 tick / moneyflow / lhb 各 1 对 service+timer
- bin/market_sync_*_run.sh wrapper 脚本(不做法定节假日过滤,fail-open)
## 3. stock_code 统一为带 SH/SZ/BJ 前缀
- 历史 bug:stocks.code 用 SH600519,但 kline/moneyflow/tick_trade/kline_5min
/stock_sector_map/industry 6 张表用纯 6 位 600519,跨表 JOIN 全部 0 行
- 新增 to_hermes() 工具:6位 / 9位(mairui `000001.SZ` 格式)→ 统一 SH000001
- 5 个 task 改写:用 to_hermes(code6) 写入 stock_code
- 一次性迁移 6 张表存量 154M 行(CASE WHEN 探测 + 去重 + 加前缀)
- ORM: stock_sector_map.stock_code / industry.code String(6)→String(10)
## 4. Bug 修复
- **share table stock_code 格式**:之前写 6 位不带前缀,与 stocks 不一致
→ 修 task_share_snapshot + 一次性 UPDATE 63,417 行加前缀
- **share_snapshot warning 状态错填 last_error**:
→ 加 mark_sync_warning() 走专用路径,不写 last_failure_at / last_error
- **schedule config lastRun 不同步**:
→ 加 update_job_status_for_dataset(),SyncTask.run() 完成后自动镜像
→ cli/runall 触发的 task 也能更新 schedule config
## 5. mairui UTF-8 编码修复
- 历史 bug:mairui.py:_fetch 用 latin-1 兜底解码,把所有 UTF-8 中文名
double-encoded 写入 stocks.name(如 `歌华有线` 变成 `æ\xad\x8cå\x8d\x8e...`)
- 加 _decode_response():UTF-8 → GBK → latin-1 兜底
- 一次性修复 stocks.name 5,213 行:
- 4,370 行 (encode('latin-1').decode('utf-8') 反向解码)
- 616 行 (含 fullwidth A,宽松 printable 检查)
- 820 行 (mid-character 截断,重新从 mairui 拉)
## 6. 测试
- tests/test_smoke.py: TASKS 10→11, SYNC_DEFINITIONS 10→11
- tests/test_schema_models.py: 16→18 张表,新增 longhubang_daily/seat
- pytest 11/11 passed
## 验证
- 6 张表 0 残留无前缀行
- stocks JOIN kline_stock / kline_5min / moneyflow / tick_trade / stock_sector_map:88-100% 命中
- 5,213 stocks.name 全部正确 UTF-8 中文
- pytest 11/11 passed
This commit is contained in:
@@ -65,6 +65,16 @@ _DATASOURCE_SEED: list[tuple[str, dict, str]] = [
|
||||
},
|
||||
"K 线主源(日线 + 5min + 指数)",
|
||||
),
|
||||
(
|
||||
"datasource_akshare_lhb",
|
||||
{
|
||||
"name": "akshare 龙虎榜(东方财富封装)",
|
||||
"provides": ["longhubang_daily", "longhubang_seat"],
|
||||
"requiresCredential": False,
|
||||
"note": "龙虎榜聚合层 + 席位层;无合理替代源,按 [[no-akshare]] 决策放行",
|
||||
},
|
||||
"龙虎榜聚合层 + 席位层(akshare → 东方财富)",
|
||||
),
|
||||
]
|
||||
|
||||
|
||||
@@ -247,4 +257,7 @@ def build_default_registry() -> None:
|
||||
else:
|
||||
# 即使没 token 也注册,is_available() 会拦截
|
||||
registry.register(XueqiuSource())
|
||||
# akshare 已移除(项目级决策:永远不用)
|
||||
# akshare:2026-07-01 决策更新——龙虎榜无替代源,烟测通过,可注册。
|
||||
# 见 [[no-akshare]] 记忆:仅"无替代"+"akshare 烟测 OK"才允许用。
|
||||
from app.sources.akshare_lhb import AkshareLhbSource
|
||||
registry.register(AkshareLhbSource())
|
||||
@@ -48,6 +48,25 @@ def code6_to_mairui(code6: str) -> str:
|
||||
return f"{code6}.{code6_to_exchange(code6)}"
|
||||
|
||||
|
||||
def to_hermes(code: str) -> str:
|
||||
"""6 位代码 → 带交易所前缀(项目标准:与 stocks.code 一致)。
|
||||
|
||||
'000001' → 'SZ000001'
|
||||
'600519' → 'SH600519'
|
||||
'830xxx' → 'BJ830xxx'(北证)
|
||||
'SH600519' → 'SH600519'(已是 hermes 格式则原样返回)
|
||||
"""
|
||||
c = str(code).strip().upper()
|
||||
# 已是 hermes 格式
|
||||
if c.startswith(("SH", "SZ", "BJ")) and len(c) >= 8:
|
||||
return c
|
||||
# 6 位纯数字 → 加前缀
|
||||
if len(c) == 6 and c.isdigit():
|
||||
return f"{code6_to_exchange(c)}{c}"
|
||||
# 兜底:原样返回
|
||||
return c
|
||||
|
||||
|
||||
def normalize_kline(df: pd.DataFrame) -> pd.DataFrame:
|
||||
"""标准化日 K 线 DataFrame。
|
||||
|
||||
|
||||
Reference in New Issue
Block a user