Solana 鏈上 · 判死 判死
五個資料瑕疵,沒有一個讓策略看起來更差
更新 2,830 字 · 約 8 分鐘
八天、66,550 個幣、320,491 筆價格快照,找到五個資料問題。每一個都讓策略看起來比實際更好,沒有一個是反過來的。其中一個把「中段進場 +175%」翻成 −71%,另一個讓同一個特徵從負訊號變成 1.9 倍的正訊號。
這條線 2026-08-08 起跑、2026-08-16 結案,投入 $0,最後判死:階梯策略的期望值落在 −13% 到 −18%,六天沒有一天為正。
但這篇不是講策略為什麼不成立,是講在判死之前找到的五個資料瑕疵。它們有一個共同點:
每一個都讓策略看起來比實際更好。沒有一個是反過來的。
如果資料問題只是隨機雜訊,應該有大約一半會讓策略看起來更差。五比零不是隨機。
先講清楚:這不是樣本不足
| 觀測 | 66,550 個幣(25% 抽樣,約當 26 萬次發幣) |
| 價格快照 | 320,491 筆 |
| 期間 | 2026-08-08 到 2026-08-16,8 天 |
| 投入資金 | $0 |
判死的理由不是「再多跑一陣子說不定就成了」。最強的進場條件把成功率從 2.5% 拉到 4–5%,而策略要能成立需要的是 25% —— 差一個數量級。那是比例估計,距離需要的水準有 8 個標準誤以上。
不是樣本不夠,是東西不在那裡。
分項的樣本數多半沒有留存:VM 已終止、原始資料依當時指示未保留。下面凡是沒有寫 n 的地方,就是沒有留存,我不會回頭估一個看起來合理的數字。
五個瑕疵
| # | 瑕疵 | 它讓什麼變好看 |
|---|---|---|
| ① | 最強的混淆因子是「用哪個工具發幣」 | 一個正訊號被壓成負訊號,控制後反轉 |
| ② | 多池取最高價,挑中流動性 $5 的垃圾池 | 階梯期望值被灌成 2–4 倍 |
| ③ | 曲線資料違反單調不變量,31% 的紀錄是垃圾 | 「中段進場 +175%」實際是 −71% |
| ④ | 極端值沒有逐一驗證 | 最大的四筆裡三筆是假的 |
| ⑤ | 起始參數被寫成常數 | 曲線進度算錯,方向不定但偏樂觀 |
瑕疵 ①:混淆因子讓訊號的正負號反過來
代幣的中繼資料裡有一個欄位直接反映它是用哪個工具發出來的。原生工具與機器人批量工具的成功率差 4 倍以上(5.5% 對 0–1.3%)。
而機器人工具會自動填滿社群欄位、自動掛一則爆紅推文。於是「這個幣蹭了爆紅推文」這個特徵,被大量的機器人發幣汙染:
| 「蹭爆紅推文」的成功率 | |
|---|---|
| 沒有控制發幣工具 | 1.84% ← 看起來是負訊號 |
| 控制發幣工具之後 | 5.88% ← 1.9 倍增益,是正訊號 |
同一個特徵,結論完全相反。
這是 Simpson’s Paradox 的教科書形態:兩個變數在整體資料上呈現一種關聯,在每個子群裡卻是另一種,甚至反向(Stanford Encyclopedia of Philosophy,查證日期 2026-08-27)。
實務上的教訓比理論更難:你不會知道哪個欄位是混淆因子,除非你先想到它可能是。 我是在查另一件事的時候撞到的。
瑕疵 ②:取最高價,取到一個賣不掉的價格
同一個代幣可能同時存在好幾個流動池。原本的做法是取「所有池子裡的最高價」,聽起來像是保守地捕捉到最好的機會。
實際挑中的是一個流動性只有 $5 的垃圾池,它的報價比真實價格高 7 萬倍(真價 1.793e-8,垃圾池 1.285e-3)。
更糟的是那個欄位是累積型的(記錄歷史最高價),一次壞值就永久留在資料裡,不會自我修復。整份階梯期望值被灌成 2 到 4 倍。
正解有三條:只收同一種報價幣的池、要求最低流動性、取流動性最高的池而不是價格最高的池。
這不只是資料問題,是經濟問題
Uniswap 的運作說明(查證日期 2026-08-27)把定價寫成 x * y = k,並指出相對於池深度越大的交易,價格衝擊越大。
把這句話套到一個 $5 的池子上:你在那個價格上根本賣不掉任何有意義的數量。那個報價不可成交,所以取最高價在經濟上也是錯的,不是只有統計上錯。
辨識徵兆:所有極端值都集中在同一類樣本。當時 13 個 100 倍以上的紀錄全部來自同一類,而另一類的最高只有 19 倍 —— 19 倍剛好是那條曲線的天花板。一個真實的分布不會這樣分層。
瑕疵 ③:用領域不變量抓壞資料
這條是五個裡面方法論價值最高的。
那條定價曲線是單調上升的,所以「較晚的價格低於起始價」在數學上不可能發生。寫下這條不變量,然後去數有幾筆違反:
31% 的紀錄違反。
原因是某些發幣工具的曲線帳戶版位跟主流工具不同,解析出來的數字是垃圾。而那些垃圾正好製造出「數百倍報酬」的假象。
清掉之後,那個最漂亮的結論翻轉了:
「中段進場 ROI +175%」→ −71%
〈我的回測說 13.25 倍,稽核完剩 2.26 倍〉那篇是同一種翻轉在美股回測上的版本。兩次的共同點是:沒有人會去查一個符合預期的好結果。
每加一個衍生欄位,先寫下它必須滿足的不變量,然後去數有幾筆違反。
這條之所以有效,是因為它不依賴直覺。2026-08 那批資料裡違反不變量的 31% 紀錄每一筆單獨看都不奇怪 —— 一個數字大一點小一點,你不會覺得有問題。只有在寫下「這件事不可能發生」之後,它們才會一次全部現形。
這也是為什麼績效資料的產生腳本會在寫檔前跑一組不變量,違反就不寫檔。〈檢查因為錯誤的理由而通過〉那篇講的是同一個家族的問題:檢查存在,但它檢查的東西不對。
瑕疵 ④:極端值要逐一對線上驗證
最大的四筆紀錄,逐一去對當時的線上狀態:
| 這一筆 | 存的值 vs 現價 | 池子流動性 | 判定 |
|---|---|---|---|
| 第 1 筆 | 一致 | $285,000(市值 1,507 萬) | 真的,474 倍 |
| 第 2 筆 | 高 4,227 倍 | $1,400–2,000 | 假的 |
| 第 3 筆 | 高 82 倍 | $1,400–2,000 | 假的 |
| 第 4 筆 | 高 555 倍 | $1,400–2,000 | 假的 |
真實大漲的池子深度是假高點的 100 倍以上。 這給了一條可用的過濾線索,但它擋不住全部 —— 其中一筆有 $1,671 的流動性,仍然報出 4,000 倍的假價。所以流動性要另外存成欄位,分析時再過濾,不能只在收集時卡一個門。
NIST 的統計手冊在離群值那一節(§7.1.6,查證日期 2026-08-27)寫的是:離群值應該被仔細調查,它們往往帶有關於資料收集與記錄過程的重要資訊。這四筆正是如此 —— 那三筆假的告訴我的不是市場,是我的抓取管線。
瑕疵 ⑤:起始參數被寫成常數
不同代幣的起始虛擬儲備不一樣,實測至少有兩種不同的值。曲線進度如果用寫死的常數去算,算出來的位置就是錯的。
正解是用該幣自己的首次觀測值自校準,不要假設一個全域常數。這條的修法很短,但它跟瑕疵 ② 的修法一樣,都是把「我以為固定的東西」改成「每一筆自己帶著的東西」。
這條的教訓跟前四條同源:我假設了一個會變的東西不會變。
🔴 我自己的一個推理錯誤
這篇如果只列資料的錯,就漏了最貴的那一個。
我曾經下過一個結論:「沒有買單就賣不掉,所以停損不可行。」
在曲線階段這是錯的。 那條定價曲線本身就是造市商,它由池中的準備金算出價格,永遠有報價。沒有人買的幣照樣可以賣回曲線,損失的是手續費與價差,不是全部。
這個錯誤讓我一度誤判整條線的風險控制沒有著力點。
在 AMM 上,「沒有成交量」不等於「沒有流動性」。兩者要分清楚。
真正的薄池問題發生在代幣畢業之後的另一個場所,那時候的報價才會不可信——也就是瑕疵 ② 講的那件事。同一條線上,同一個詞(流動性)在兩個階段意思不一樣,而我用同一套直覺去理解它。
出場設計在這條線上的完整對照寫在〈出場規則換一下,同一批交易從 −86% 變 +3%〉。
另外兩件會影響結論的事
制度轉變。 某個平台功能上線之後,畢業率從 0.198% 跳到 1.045%,五倍以上。任何跨期統計在引用之前,都要先確認樣本落在制度轉變的哪一邊。把兩邊混在一起算平均,得到的是一個在兩個制度下都不存在的數字。
節奏。 從發幣到觸及最高價的時間分布是:p50 = 0 分、p75 = 2 分、p90 = 10 分、p99 = 103 分。
一半的幣在第一分鐘之內就走完了全部漲幅。任何「等幾個小時再觀察」的設計都不是保守,是誤解了這個市場的時間尺度。
為什麼五個的方向會一致
這才是這篇真正的結論,比任何單一數字重要。
資料問題不是隨機分布的。它們系統性地偏向「讓你想看到的東西成立」,原因不在資料,在流程:
你只有在結果不符合預期的時候才會去查。 合乎預期的那些,你不會回頭看第二眼。
所以 2026-08 這八天留下來的五個瑕疵全部偏向同一邊,不是因為壞資料剛好都往好的方向壞,是因為往壞的方向壞的那些,早就在第一時間被我查掉了 —— 查掉之後我不會記得它是「一個瑕疵」,只會記得「那天有個數字怪怪的,後來修好了」。
留下來被寫進這篇的五個,全部是通過了我當時那一關的。這就是為什麼判準要事前寫死、不變量要事前寫下來:事後的檢查會自動對齊你的期待。
常見問題
這條線判死了,為什麼還要寫這麼長? 因為策略死了,五個瑕疵不會死。混淆因子、不可成交的報價、不變量、極端值逐一驗證、常數假設 —— 這五樣在任何一條線上都會再出現一次,而且它們的破壞力遠大於進場條件選錯。
為什麼可以把細節全寫出來? 這條線 2026-08-16 結案、投入 $0、VM 已終止、原始資料未保留。公開它不會讓任何人跟到任何還在運作的東西。仍在運作的線的參數,這個站上一個字都沒有,理由寫在〈方法論〉。
分項的 n 為什麼都沒有? 未留存。VM 已終止、原始資料依當時指示未保留。可以引用的整體規模只有 66,550 個幣 / 320,491 筆快照 / 8 天,其餘的比例數字要當成單一樣本的觀察,不是統計結論。
只跑八天會不會太短? 對於「這個策略能不能賺錢」,八天確實短。但這篇的結論不是統計顯著性,是成功率差了一個數量級(4–5% 對需要的 25%),以及五個資料瑕疵的方向性。後者跟時間長短無關。