research: 影子交易器落在 Hummingbot 上,并修掉 Bitget 连接器的换根延迟

1m 腿的滑点余量只有几个 bp,所以要测的必须是生产路径的滑点——换个运行时
测出来的数就不作数。框架因此从「滑点已知后再定」提前到测量阶段就定为
Hummingbot(Spot/Perp 连接器均 v2.0,Bitget 是 Foundation Partner)。

新增 research/live/。前置测量:

- bench_compute.py 本机算力,1m 单币 0.318s、三币串行 1.38s
- venue_parity.py Binance 与 Bitget 同根信号重合仅 14.6~42.6%
- signal_sensitivity.py 0.25bp 扰动就换掉一半信号
- aggregate_robustness.py 但总体期望不降——脆的是信号身份,不是 alpha
- bitget_baseline.py 因此改用 Bitget 原生基线定预算:余量 BTC -0.13bp、
  ETH +4.02bp、SOL +2.92bp。BTC 本就为负,只作延迟测量的参照物

运行时选型:

- parity_env.py 容器与本机信号逐一相同(下标、中枢数、checksum 全等),
  容器内 0.26s/币反而更快。故 chanlun 直接挂载进容器,不必另起信号服务。
  装进现有 .venv 那条路走不通:Hummingbot 要 numba>=0.61.2 与
  aiohttp<3.14,与本机 Python 3.14 冲突
- latency_ccxt.py / latency_hummingbot.py / latency_compare.py 初测显示
  Hummingbot 比 ccxt.pro 慢约 1030ms,90 根逐根配对里 80~97% 更慢
- probe_ws_action.py 否掉「丢弃 snapshot」的猜测:换根首条就是 update
- probe_hb_vs_raw.py 与 latency_attribute.py 四路归因——容器网络 2~18ms、
  Hummingbot 处理 -10~-30ms,1350~1480ms 全落在解析方式上
- probe_ws_payload.py 定位根因:Bitget 换根会推一条带两根的消息
  [上一根, 新一根],而上游取 data["data"][0] 拿到的是上一根,新一根要等
  下一条单元素消息

修复:

- patched_candles.py 处理消息里的全部元素。不能简单改成 [-1]——那样上一根
  的收盘价会永远停在换根前约 1 秒的那次推送上,而信号对 0.25bp 都敏感
- verify_patch.py 60 根配对验证:拿回 1060~1090ms,与原始 WS 只差 5~14ms
  已贴理论下限,19 根已收盘 K 线 OHLCV 逐根未变。折算 ETH 省 0.54bp、
  SOL 省 0.42bp。此 bug 值得向上游反馈

影子交易器:

- shadow_hb.py 不下单,读连接器真实盘口按仓位吃单深度算成交价,与次根开盘价
  (回测 entry_delay=1 的口径)相减,分解成延迟漂移、盘口价差、深度冲击。
  盘口 10Hz 滚动缓冲 30 秒,把延迟变成自变量:每个信号记 0.5/1/2/5s 与实际
  算完时刻各一个滑点值,本机算得慢也不影响能读出的曲线
- shadow_signal.py 信号计算隔离到子进程。0.26s 是纯 CPU 且 chanlun 受 GIL
  限制,放进 asyncio 循环会把行情处理一起卡住
- shadow_report.py 首日延迟门槛与滑点曲线报表

不用 paper trade 测滑点:它的成交由 Hummingbot 自己的撮合模型模拟,
测出来是模型行为而非市场行为。

Co-authored-by: Cursor <cursoragent@cursor.com>
This commit is contained in:
Ubuntu
2026-08-27 23:51:57 +08:00
co-authored by Cursor
parent 66061f79a1
commit 7e339d2a54
44 changed files with 11946 additions and 0 deletions
+186
View File
@@ -0,0 +1,186 @@
"""最关键的一步:逐笔清单不可复现,总体期望还在不在。
signal_sensitivity 证明 0.25bp 的数据扰动就能换掉一半信号。这本身不判死刑——
趋势跟随策略允许「成交的具体是哪几笔」随机,只要总体期望稳定就仍可交易。
但如果扰动后 PF 与毛均收益也跟着塌,那回测测的就是噪声。
两种结果对应完全不同的下一步:
总体稳定 -> 改成「Bitget 原生信号测滑点 + Bitget 原生回测基线」,主线继续
总体也塌 -> 滑点根本不是瓶颈,1m 腿的问题在信号定义本身,影子交易器白写
口径与 step23 一致:SL/TP/MAX_BARS = 1.5/3.0/48ATR 取信号根,
入场为信号次根开盘价(entry_delay=1),成本 4bp 手续费 + 1bp 滑点。
3.91bp 的滑点预算就是从「毛均收益 +0.0991%」推出来的,所以毛均收益是主看指标。
输出 out/aggregate_robustness.csv。
"""
from __future__ import annotations
import argparse
import os
import sys
import time
import warnings
from pathlib import Path
import numpy as np
import pandas as pd
warnings.filterwarnings("ignore")
for v in ("OMP_NUM_THREADS", "OPENBLAS_NUM_THREADS", "MKL_NUM_THREADS"):
os.environ.setdefault(v, "1")
HERE = Path(__file__).resolve().parent
RESEARCH = HERE.parent
sys.path.insert(0, str(RESEARCH))
sys.path.insert(0, str(RESEARCH.parent))
sys.path.insert(0, str(HERE))
pd.set_option("display.width", 260)
from signal_sensitivity import TICK, perturb # noqa: E402
SYMS = ("BTC", "ETH", "SOL")
LEVELS = (0.0, 0.5, 1.0, 2.0)
SL, TP, MAX_BARS = 1.5, 3.0, 48
FEE, SLIP = 0.0004, 0.0001
def run_once(df_l: pd.DataFrame, df_h: pd.DataFrame) -> pd.DataFrame:
"""跑完整管线并逐笔模拟,返回交易表。"""
from chanlun import TF_DF
from lib.breakout import run_trades
from lib.fast_bsp3 import find_fast_bsp3
from lib.fx_signal import extract_fx_signals, signals_to_frame
from lib.nested_bsp import attach_htf_context, htf_fx_timeline
from lib.nested_level import build_htf_zones
chan_l = TF_DF(df_l, 1, "1m")
cdf = chan_l.dataframe
zones = build_htf_zones(cdf, "1m", chan=chan_l)
if zones.empty:
return pd.DataFrame()
sig = find_fast_bsp3(cdf, zones.reset_index(drop=True))
if sig.empty:
return pd.DataFrame()
chan_h = TF_DF(df_h, 1, "5m")
hdf = chan_h.dataframe
tl = htf_fx_timeline(signals_to_frame(extract_fx_signals(chan_h, hdf)), hdf)
full = attach_htf_context(sig, cdf, tl, "h1")
fin = full[full["h1_agree"] == 1]
if fin.empty:
return pd.DataFrame()
entries = list(zip(fin["entry_idx"].astype(int), fin["direction"].astype(int)))
return run_trades(cdf, entries, SL, TP, MAX_BARS,
fee=FEE + SLIP, entry_delay=1)
def stats(tr: pd.DataFrame) -> dict:
if tr.empty:
return {"笔数": 0}
g = tr["gross"].to_numpy(dtype=float)
n = tr["ret"].to_numpy(dtype=float)
win, loss = n[n > 0].sum(), -n[n < 0].sum()
return {
"笔数": len(tr),
"胜率": f"{(n > 0).mean() * 100:.1f}%",
"毛均收益": f"{g.mean() * 100:+.4f}%",
"净均收益": f"{n.mean() * 100:+.4f}%",
"PF": round(win / loss, 2) if loss > 0 else np.inf,
"t值": round(n.mean() / n.std(ddof=1) * np.sqrt(len(n)), 2) if len(n) > 1 else np.nan,
"滑点余量bp": round(g.mean() * 1e4 - 6.0, 2),
}
def main() -> None:
ap = argparse.ArgumentParser()
ap.add_argument("--symbols", default="BTC,ETH,SOL")
ap.add_argument("--bars", type=int, default=200_000, help="每币用多少根 1m")
ap.add_argument("--seeds", type=int, default=2)
ap.add_argument("--levels", default=None,
help="逗号分隔的噪声档(bp);只给 0 就是纯基线复现")
ap.add_argument("--tag", default="", help="产物文件名后缀")
args = ap.parse_args()
levels = (tuple(float(x) for x in args.levels.split(","))
if args.levels else LEVELS)
from lib.data import load_local
syms = [s.strip() for s in args.symbols.split(",")]
print(f"[总体稳健性] {syms} · 每币 {args.bars} 根 1m "
f"({args.bars / 1440:.0f} 天) · 噪声档 {levels} bp\n", flush=True)
rows = []
for sym in syms:
df_l = load_local(f"{sym}/USDT:USDT", "1m")
df_h = load_local(f"{sym}/USDT:USDT", "5m")
if df_l is None or df_h is None:
print(f"{sym}: 本地无数据,跳过")
continue
df_l = df_l.tail(args.bars).reset_index(drop=True)
lo = int(df_l["timestamp"].iloc[0])
df_h = df_h[df_h.timestamp >= lo].reset_index(drop=True)
print(f"── {sym} {len(df_l)} 根 1m / {len(df_h)} 根 5m "
f"{df_l['date'].iloc[0]:%Y-%m-%d} ~ {df_l['date'].iloc[-1]:%Y-%m-%d}",
flush=True)
for bp in levels:
for k in range(1 if bp == 0 else args.seeds):
t0 = time.perf_counter()
tr = run_once(perturb(df_l, bp, TICK[sym], 2000 + k), df_h)
s = stats(tr)
rows.append({"品种": sym, "噪声bp": bp, "种子": k, **s})
print(f" 噪声 {bp:>4.2f}bp 种子{k}: " +
" · ".join(f"{k2} {v}" for k2, v in s.items()) +
f" [{time.perf_counter() - t0:.0f}s]", flush=True)
if not rows:
print("无结果")
return
tb = pd.DataFrame(rows)
print("\n" + "=" * 130)
print("########## 1. 逐币 × 噪声档 ##########")
print(tb.to_string(index=False))
print("\n########## 2. 三币合并(同噪声档取均值)##########")
num = tb.copy()
num["毛均bp"] = num["毛均收益"].str.rstrip("%").astype(float) * 100
num["净均bp"] = num["净均收益"].str.rstrip("%").astype(float) * 100
num["胜率_"] = num["胜率"].str.rstrip("%").astype(float)
agg = num.groupby("噪声bp").agg(
笔数=("笔数", "mean"), 胜率=("胜率_", "mean"),
毛均bp=("毛均bp", "mean"), 净均bp=("净均bp", "mean"),
PF=("PF", "mean"), t值=("t值", "mean")).round(2)
agg["滑点余量bp"] = (agg["毛均bp"] - 6.0).round(2)
print(agg.to_string())
print("\n########## 结论 ##########")
print(" step23 的 1m 基线(3 币 3578 笔 / 2.28 年):毛均 9.91bp · PF 2.31 · "
"t 19.92 · 余量 3.91bp")
if 0.0 not in agg.index:
print(" 本次未跑无噪声档,无法给出相对基线的比例")
return
base = agg.loc[0.0]
print(f" 无噪声基线:毛均 {base['毛均bp']:.2f}bp · PF {base['PF']:.2f} · "
f"t {base['t值']:.2f} · 滑点余量 {base['滑点余量bp']:.2f}bp")
for bp in levels[1:]:
if bp not in agg.index:
continue
r = agg.loc[bp]
print(f" 噪声 {bp}bp:毛均 {r['毛均bp']:.2f}bp "
f"({r['毛均bp'] / base['毛均bp'] * 100:.0f}% of 基线) · "
f"PF {r['PF']:.2f} · t {r['t值']:.2f} · 余量 {r['滑点余量bp']:.2f}bp")
print("\n 毛均与 PF 若基本持平 → 逐笔身份随机但总体期望稳定,主线继续,")
print(" 但必须换成 Bitget 原生回测基线,Binance 的逐笔清单不可用于对照。")
print(" 若毛均随噪声单调下滑 → 回测吃的是数据噪声,滑点不是瓶颈。")
out = RESEARCH / "out" / f"aggregate_robustness{args.tag}.csv"
tb.to_csv(out, index=False)
print(f"\n产物写入 {out}")
if __name__ == "__main__":
main()