本文延續〈台灣熊市機率模型完整方法論〉第十節「後續研究藍圖」列出的待辦事項——真實資料回測、權重重新估計、部位規則實測——逐一報告完成後的真實結果。
一、先講結論
方法論文章第七節用模擬資料驗證方法論本身時,水準+動量模型的 AUC-ROC 達到 0.85。這是一個相當漂亮的數字,但模擬資料的本質是「照著我們想驗證的假設去產生資料」,並不代表模型接上真實世界的雜訊後也能維持這個水準。
真實歷史資料(2022-07-18 至 2026-07-18,週頻取樣,共 194 個資料點)的回測結果是:
| 指標 | 數值 |
|---|---|
| AUC-ROC | 0.4875 |
| Precision | 18.42% |
| Recall | 17.95% |
| F1-Score | 18.18% |
0.4875 只比擲硬幣(0.5)略低。誠實地說,這代表目前的模型在區辨「未來會不會進入系統性下跌」這件事上,幾乎沒有真正的判別力。這不是我們想看到的結果,但正是方法論文章第九節所說「權重尚未以真實資料重新估計」這個但書真正被驗證的時刻——與其在資料不夠時自我感覺良好,不如誠實報告,再逐項檢查可能的改善方向。
二、模擬與真實之間的落差,從哪裡來
三個結構性原因,值得攤開來看:
模擬資料是為了驗證方法論,不是為了預測市場。 第七節的模擬回測刻意產生了「動量因子確實領先水準因子」這樣的資料型態,目的是確認模型架構本身(水準+動量的雙因子邏輯、Logistic 函數、分位數標準化)在資料符合假設時能否正確運作。這個目的達成了;但市場資料是否真的符合這個假設,是完全獨立的問題。
樣本本身偏小,且正例(危機週)稀少。 194 個週頻資料點中,只有約五分之一被標記為系統性下跌週。這個比例本身就讓 AUC 的估計值帶有相當大的不確定性——後面第五節會用一個真實觀察到的例子說明這件事。
線性 Logistic 模型的自由度有限。 四個維度、八個係數(四個水準+四個動量),面對的是充滿非線性交互作用的真實金融市場。模型能不能捕捉到訊號,高度取決於這四個維度的底層變數選得好不好——這正是第四節要報告的部分。
三、權重重新估計:嘗試過,但沒有通過驗證
方法論文章明確標註 、、 是「研究初期的經驗性設定」,並非以真實資料估計而來。我們針對這組權重進行了重新估計的嘗試(內部代號 part2-illustrative-v2)。
單次比較中,重新估計後的權重將 AUC 從 0.4746 推升至 0.4875——看起來是進步,但這個結果沒有在重複回測中穩定重現,因此沒有被採用為正式版本。目前線上運作的仍是原始的示範權重(part2-illustrative-v1)。
這裡刻意不採用「單次比較勝出」的結果,原因與下一節的雜訊基準直接相關:一次比較不足以說明什麼,重點是能不能穩定勝出。
四、尋找更好的資金緊縮指標:三個都沒有過關
方法論文章的 (資金緊縮)目前只用兩個底層變數:10 年期美債實質殖利率與 Fed 資產負債表規模。我們測試了三種業界常見的替代/補充指標,看能不能提升 的訊號品質:信用利差(High Yield 利差)、殖利率曲線斜率,以及芝加哥聯邦準備銀行的全國金融狀況指數(NFCI)。
驗證標準採用「基準 AUC + 雜訊基準(約 ±0.02)」,也就是必須穩定超過 0.5074,而不只是單次略高於基準:
| 候選指標 | AUC | 與基準相比 | 是否過關 |
|---|---|---|---|
| 信用利差 | 0.4448 | −0.0426 | 否,甚至低於基準 |
| 殖利率曲線斜率 | 0.4991 | +0.0118 | 否,在雜訊範圍內 |
| NFCI | 0.5020 | +0.0146 | 否,最接近但仍在雜訊範圍內 |
三個候選都沒有通過門檻。這個過程中也抓到兩個真正的資料工程問題——一個是複合分數在子變數缺乏歷史資料時會靜默排除該變數而非報錯,導致一次早期測試其實只測了單一變數;另一個是動量項的計算曾經漏接替代指標設定,導致三個實驗的動量項其實都還是用原本的基準指標算的。兩個問題修正後才得到上表這個誠實的結果——這正是雜訊基準與重複驗證存在的意義:不是為了證明模型有效,而是防止把程式問題誤讀成市場訊號。
結論: 維持原本的兩個底層變數,暫不採用任何替代指標。
五、雜訊基準:一個意外的真實佐證
在正式定義「±0.02 雜訊基準」這個驗證門檻之前,我們其實已經在兩次相近日期的讀數中親眼看到這個現象:2026 年 7 月 16 日的每日速報中,完整四維模型的樣本外回測 AUC 為 0.47;兩天後(7 月 18 日)用於本文的正式回測讀數是 0.4875。同一個模型架構、只差兩天的資料,AUC 就自然浮動了超過 0.017。
這不是模型變好或變壞了,只是反映了小樣本下 AUC 估計值本身的變異程度。這也是為什麼第三、四節都刻意用「有沒有穩定超過基準+雜訊」而非「這次有沒有比較高」作為判斷標準——單一數字,尤其是小樣本的單一數字,很容易被誤讀成訊號。
六、部位管理規則的真實表現
方法論文章第七節用模擬資料測試簡單的部位規則( 滿倉、 減半、 接近空手),最大回撤從買進持有的 −42.4% 收斂至 −31.2%,是相當正面的結果。
同一套規則接上真實資料、真實 TAIEX 歷史走勢後,累積報酬是 207.49%,同期間買進持有策略的報酬是 213.61%——換句話說,這套系統化減碼規則的真實報酬,反而略遜於什麼都不做的買進持有。
會這麼判斷是因為第一節的 AUC 已經先給了答案:一個判別力接近隨機的模型,其部位規則沒有理由系統性優於買進持有。這個結果和第一節的 AUC 是一致的,而不是獨立的意外——放在一起報告,才是完整的真實檢驗,而不是只挑對模型有利的那個數字。
七、現在的誠實立場
把以上幾節放在一起:
- 基準模型的真實判別力接近隨機(AUC 0.4875)。
- 權重重新估計、三種資金緊縮替代指標,都沒有帶來穩定、可重現的改善。
- 部位管理規則的真實報酬不如買進持有。
這不是一篇「模型有效」的文章。誠實地說,目前的證據還不足以支持這套模型具備實際的市場判別力。但這不代表整個研究方向錯了,原因有三個仍待檢驗的可能性:
樣本仍然偏小。 194 個週頻資料點、約五分之一為危機週,這個規模足以計算出一個 AUC 數字,但不足以有信心地說「這個架構在任何條件下都沒有訊號」。
目前只調整過兩個槓桿。 權重與 的底層變數之外,(貿易/庫存)、(能源通膨)、(市場結構)的底層變數選擇、危機事件的定義門檻(目前設定為 20% 回撤)、乃至於線性模型本身的架構,都還沒有被系統性檢驗過。
即時資料的累積才剛開始。 每日自動化的資料管線與風險評分才運作約十天,尚未經歷過一次真正的市場轉折。回測能告訴我們模型在歷史事件上的表現,但無法取代看著模型在真實、即時發生的市況中如何反應。
八、下一步
短期內不會再急著調整權重或替換指標,而是回到累積真實資料這件更基礎的事——原因在第七節第三點已經說得很清楚:目前的即時資料歷史還太短,任何進一步的模型調整都會建立在同樣單薄的基礎上。
接下來幾個月,計畫是讓每日自動化管線持續累積真實觀測值,並在有足夠新資料、或市場出現真正的轉折訊號時,重新檢視模型表現,而不是急著在單薄的樣本上做更多調整。方法論文章第十節列出的幾項待辦(多重共線性診斷、 切換為正式分位數標準化、危機標籤定義的重新檢視)也會在這段期間陸續進行。
常見問題
既然真實回測結果不理想,為什麼還要公開這篇文章? 因為誠實揭露負面結果,本身就是這個研究計畫從一開始就設定的原則——方法論文章第九節已經先說明「權重尚未以真實資料重新估計」這個但書,這篇文章就是那個但書被驗證後的真實結果。隱藏不理想的結果只會讓下一次的判斷建立在錯誤的信心上。
AUC 0.4875 是不是代表模型完全沒用? 嚴格來說,這代表目前這組權重與這四個維度的組合,在這個真實歷史樣本上沒有展現出穩定優於隨機的判別力。但如第七節所述,樣本規模、危機定義、底層變數選擇都還有調整空間,現在下「這個方向完全不可行」的結論同樣為時過早。
權重重新估計、三個 替代指標都沒有過關,之後還會嘗試其他方向嗎? 會,但會先讓即時資料多累積一段時間,而不是急著在同樣的樣本上不斷嘗試新的變數組合——這麼做的風險是在小樣本上「試到剛好過關」的假陽性結果,而不是真正穩定的改善。
部位規則報酬不如買進持有,是不是代表這套風險管理邏輯本身有問題? 目前無法區分「部位規則邏輯有問題」跟「判別模型本身沒有訊號,任何建立在它之上的規則自然也不會有效」這兩種可能。由於第一節已經確認判別力接近隨機,現階段沒有理由先去檢討部位規則的設計,而是先把判別力的問題解決。
本文所述之真實回測結果,僅作為量化研究方法論之揭露與學術討論之用,不構成任何實質投資買賣建議。文中所有機率、AUC 與報酬數字皆為特定歷史樣本區間之回測結果,不代表模型的未來表現,亦不應被解讀為可直接操作之交易訊號。投資人應獨立評估自身風險,並於進行實際投資決策前諮詢專業意見。