Files
Chan/research/live/latency_compare.py
T
UbuntuandCursor 7e339d2a54 research: 影子交易器落在 Hummingbot 上,并修掉 Bitget 连接器的换根延迟
1m 腿的滑点余量只有几个 bp,所以要测的必须是生产路径的滑点——换个运行时
测出来的数就不作数。框架因此从「滑点已知后再定」提前到测量阶段就定为
Hummingbot(Spot/Perp 连接器均 v2.0,Bitget 是 Foundation Partner)。

新增 research/live/。前置测量:

- bench_compute.py 本机算力,1m 单币 0.318s、三币串行 1.38s
- venue_parity.py Binance 与 Bitget 同根信号重合仅 14.6~42.6%
- signal_sensitivity.py 0.25bp 扰动就换掉一半信号
- aggregate_robustness.py 但总体期望不降——脆的是信号身份,不是 alpha
- bitget_baseline.py 因此改用 Bitget 原生基线定预算:余量 BTC -0.13bp、
  ETH +4.02bp、SOL +2.92bp。BTC 本就为负,只作延迟测量的参照物

运行时选型:

- parity_env.py 容器与本机信号逐一相同(下标、中枢数、checksum 全等),
  容器内 0.26s/币反而更快。故 chanlun 直接挂载进容器,不必另起信号服务。
  装进现有 .venv 那条路走不通:Hummingbot 要 numba>=0.61.2 与
  aiohttp<3.14,与本机 Python 3.14 冲突
- latency_ccxt.py / latency_hummingbot.py / latency_compare.py 初测显示
  Hummingbot 比 ccxt.pro 慢约 1030ms,90 根逐根配对里 80~97% 更慢
- probe_ws_action.py 否掉「丢弃 snapshot」的猜测:换根首条就是 update
- probe_hb_vs_raw.py 与 latency_attribute.py 四路归因——容器网络 2~18ms、
  Hummingbot 处理 -10~-30ms,1350~1480ms 全落在解析方式上
- probe_ws_payload.py 定位根因:Bitget 换根会推一条带两根的消息
  [上一根, 新一根],而上游取 data["data"][0] 拿到的是上一根,新一根要等
  下一条单元素消息

修复:

- patched_candles.py 处理消息里的全部元素。不能简单改成 [-1]——那样上一根
  的收盘价会永远停在换根前约 1 秒的那次推送上,而信号对 0.25bp 都敏感
- verify_patch.py 60 根配对验证:拿回 1060~1090ms,与原始 WS 只差 5~14ms
  已贴理论下限,19 根已收盘 K 线 OHLCV 逐根未变。折算 ETH 省 0.54bp、
  SOL 省 0.42bp。此 bug 值得向上游反馈

影子交易器:

- shadow_hb.py 不下单,读连接器真实盘口按仓位吃单深度算成交价,与次根开盘价
  (回测 entry_delay=1 的口径)相减,分解成延迟漂移、盘口价差、深度冲击。
  盘口 10Hz 滚动缓冲 30 秒,把延迟变成自变量:每个信号记 0.5/1/2/5s 与实际
  算完时刻各一个滑点值,本机算得慢也不影响能读出的曲线
- shadow_signal.py 信号计算隔离到子进程。0.26s 是纯 CPU 且 chanlun 受 GIL
  限制,放进 asyncio 循环会把行情处理一起卡住
- shadow_report.py 首日延迟门槛与滑点曲线报表

不用 paper trade 测滑点:它的成交由 Hummingbot 自己的撮合模型模拟,
测出来是模型行为而非市场行为。

Co-authored-by: Cursor <cursoragent@cursor.com>
2026-08-27 23:51:57 +08:00

123 lines
4.7 KiB
Python
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
"""把两侧 t_data t_close 对齐,并折算成 bp,与滑点余量对照。
为什么要折算成 bp 才有意义:延迟本身不花钱,花钱的是延迟期间价格的漂移。
按随机游走,t 秒的价格标准差是 σ_1m · √(t/60),其中 σ_1m 是本币 1m 收益
的标准差。入场方向上还有系统性追价(信号触发往往伴随同向动量),所以随机
漂移只是下限,真实成本更高——这也是为什么最终仍要用真实盘口测滑点。
余量(bitget_baseline.py 得出,Bitget 原生基线减去手续费后剩下的空间):
BTC -0.13bp ETH +4.02bp SOL +2.92bp
BTC 本就为负,留着只作延迟测量的参照物,不作交易标的。
.venv/bin/python research/live/latency_compare.py
"""
from __future__ import annotations
import sys
from pathlib import Path
import numpy as np
import pandas as pd
HERE = Path(__file__).resolve().parent
RESEARCH = HERE.parent
sys.path.insert(0, str(RESEARCH))
OUT = RESEARCH / "out"
BUDGET_BP = {"BTC": -0.13, "ETH": 4.02, "SOL": 2.92}
SYMS = ("BTC", "ETH", "SOL")
def vol_bp_per_min() -> dict[str, float]:
"""从 Bitget 缓存算 1m 收益标准差,单位 bp。"""
out = {}
for s in SYMS:
f = HERE / "cache" / f"bitget_{s}_1m_30d.feather"
if not f.exists():
f = HERE / "cache" / f"bitget_{s}_1m_210d.feather"
if not f.exists():
continue
df = pd.read_feather(f)
r = np.log(df["close"].to_numpy(dtype=float))
out[s] = float(np.nanstd(np.diff(r)) * 1e4)
return out
def drift_bp(lag_ms: float, vol: float) -> float:
"""随机游走下,lag 毫秒对应的价格漂移标准差(bp)。"""
return vol * np.sqrt(max(lag_ms, 0) / 60_000.0)
def load(tag: str) -> pd.DataFrame | None:
f = OUT / f"latency_{tag}.csv"
if not f.exists():
return None
df = pd.read_csv(f)
return df if not df.empty else None
def describe(df: pd.DataFrame, name: str, vols: dict) -> None:
print(f"\n########## {name}t_data t_close ##########")
print(f"{'币':<5}{'n':>5}{'中位ms':>9}{'P90ms':>9}{'最大ms':>9}"
f"{'中位漂移bp':>12}{'余量bp':>9}{'占余量':>9}")
for s in SYMS:
v = df[df["sym"] == s]["lag_ms"].to_numpy(dtype=float)
if not len(v):
continue
med, p90 = float(np.median(v)), float(np.percentile(v, 90))
vol = vols.get(s)
d = drift_bp(med, vol) if vol else float("nan")
b = BUDGET_BP[s]
share = f"{d / b * 100:.0f}%" if b > 0 else "—(负)"
print(f"{s:<5}{len(v):>5}{med:>9.0f}{p90:>9.0f}{v.max():>9.0f}"
f"{d:>12.2f}{b:>9.2f}{share:>9}")
def main() -> None:
vols = vol_bp_per_min()
print("1m 收益标准差(bp/分钟,Bitget 缓存实测):")
for s, v in vols.items():
print(f" {s}: {v:.2f}")
a, b = load("ccxt"), load("hummingbot")
if a is None or b is None:
print(f"\n数据未就绪:ccxt={'有' if a is not None else '无'} "
f"hummingbot={'有' if b is not None else '无'}")
if a is not None:
describe(a, "ccxt.pro", vols)
if b is not None:
describe(b, "Hummingbot", vols)
return
describe(a, "ccxt.pro", vols)
describe(b, "Hummingbot", vols)
# 逐根配对才能消掉「不同分钟市场活跃度不同」的干扰
m = a.merge(b, on=["kline_ts", "sym"], suffixes=("_ccxt", "_hb"))
print(f"\n########## 逐根配对(重叠 {len(m)} 根)##########")
if m.empty:
print(" 两侧无重叠 K 线,无法配对;检查采集时间窗是否错开")
return
print(f"{'币':<5}{'n':>5}{'ccxt中位':>10}{'HB中位':>10}"
f"{'差值中位':>10}{'HB更慢占比':>12}{'差值→bp':>10}")
for s in SYMS:
g = m[m["sym"] == s]
if g.empty:
continue
d = (g["lag_ms_hb"] - g["lag_ms_ccxt"]).to_numpy(dtype=float)
vol = vols.get(s)
# 差值转 bp:比较两条路径各自漂移的差,而非直接对差值开方
extra = (drift_bp(float(np.median(g["lag_ms_hb"])), vol)
- drift_bp(float(np.median(g["lag_ms_ccxt"])), vol)) if vol else float("nan")
print(f"{s:<5}{len(g):>5}{np.median(g['lag_ms_ccxt']):>10.0f}"
f"{np.median(g['lag_ms_hb']):>10.0f}{np.median(d):>10.0f}"
f"{(d > 0).mean() * 100:>11.0f}%{extra:>10.2f}")
print("\n判读:差值 → bp 若显著小于余量,说明选哪个运行时不影响结论,"
"可直接用 Hummingbot(生产路径一致);若接近或超过余量,"
"则运行时本身就是成本项,需要单独优化或放弃 1m。")
if __name__ == "__main__":
main()