AIバックテストの多くは、まだ乱暴だ。
過去の価格を全部放り込み、モデルに覚えさせ、成績が良ければ「使える」と言う。
そのやり方は、TimesFMのような時系列基盤モデルでも同じ穴に落ちる。規則的な動きが続く局面では機能する。しかし相場にはランダムな衝撃がかなり混ざっている。その衝撃がノイズになり、モデルを混乱させる。
これから必要なのは、精度を盛る最適化ではない。過去のイレギュラーをできるだけ抽出し、それを除いたデータでバックテストする。抜いたイレギュラーは捨てず、未来のフォワードテストで使う。
僕らは後者を、マーケットハンドリングと呼んでいる。
これが、AI時代の新しいバックテストだ。
古いバックテストが壊れる場所
従来の検証は、一本の時系列を「ひとつの意味」として扱う。
上昇も、指標飛びも、要人発言も、日銀の介入も、流動性の枯れた夜のヒゲも、全部「過去のパターン」にする。AIは優秀なので、その全部から何かを拾う。拾ったものが再現可能な規則だとは限らない。
とくに基盤モデルは、需要予測やアクセス数のような、反復のある系列で強い。季節がある。曜日がある。ある程度、同じ形が戻ってくる。
相場は違う。同じローソク足の形に見えても、中身が違う。
- ロンドン開始の流れ
- 雇用統計の初動
- 地政学の飛び
- ポジションが一斉に決済されるだけの動き
形は似る。原因は似ない。原因が違うものを同じパターンとして学習させると、モデルは平均的に正しく、局面ごとに壊れる。あるいは、一番安全な答えに逃げる。1本前の価格をずらして出す。グラフはそれっぽい。トレードには使えない。
バックテストが美しいのに、フォワードで死ぬ理由のひとつがここだ。
相場は、規則とイレギュラーの混合物である
スマートな検証は、相場を単一の時系列だと思わない。少なくとも二層に分ける。
規則層
ある程度の持続がある。セッションの特徴、ボラティリティの塊まり、金利差が効いている局面の流れ、レンジとトレンドの切り替えのうち「状態として続く」部分。TimesFMが本来得意なのは、この層に近い。
イレギュラー層
単発の衝撃。指標、要人、介入、破綻、災害、突発的な流動性の消失。過去のチャートの形としては残るが、同じ形が同じ意味で戻ってくる保証はない。
古いAIトレードは、この二層を混ぜたまま「予測」と呼ぶ。新しいバックテストは、混ぜたまま精度を競わない。
規則層でモデルの実力を見る。イレギュラー層は、予測対象ではなく、運用で扱う対象にする。
手順は四つしかない
難しく見せる必要はない。やることは明快だ。
- 過去のイレギュラーを、できるだけ抽出する
- その影響を除いた系列を作る
- その系列だけでAIをバックテストする
- 抜いたイレギュラーを、未来のマーケットハンドリングに回す
ポイントは、イレギュラーを「邪魔者として消す」ことではない。検証から除外し、運用には残す。この分け方が、スマートさの本体である。
除去したデータで良い成績が出ても、それで完了ではない。それは「規則が続くなら、このモデルは使える」という条件付きの答えでしかない。相場は条件を守らない。だからフォワードでは、条件が壊れた瞬間を扱う技術が要る。
それがマーケットハンドリングだ。
イレギュラーの抽出は、値動きの掃除ではない
ここを雑にすると、ただの都合のいいデータ加工になる。負けた日をイレギュラーと呼べば、どの手法も勝つ。それは検証ではない。改ざんである。
抽出の基準は、値幅の大きさだけに置かない。原因側に置く。
- 事前に予定されていた経済指標
- 中銀と要人の発言
- 介入、規制、突然の取引停止
- 明らかなニュースショック
- スプレッドが異常に開いた時間
- 平時の流動性が消えた時間帯
「大きく動いたからイレギュラー」ではない。「規則モデルが知るべきでない外部衝撃だからイレギュラー」だ。
除去の仕方も、ローソク足を消して終わり、にはしない。衝撃の区間を印付けし、その寄与を切り離す。残るのは、衝撃がなかった場合に近い規則系列である。完全には取れない。それでも、「全部混ぜて学習する」よりはマシだ。
AI時代に新しいのは、この抽出自体にもモデルを使えることだ。価格だけ見ていた頃より、ニュース、指標カレンダー、出来高、スプレッド、ボラティリティの跳ねを同時に見て、何が規則で何が単発かを分けられる。ただし最終判断は、成績を良くしたい気持ちに渡してはいけない。基準は先に書く。結果を見てからイレギュラーを増やさない。
きれいなデータで見るもの、汚い現実で見るもの
除去後のバックテストで見るべきなのは、勝率の盛られた数字ではない。
- 規則が続いているとき、モデルは遅延予測に落ちていないか
- トレンドが続く局面と、レンジが続く局面で、役割が分かれているか
- コストを入れても、規則層に薄い優位が残るか
ここで落ちるなら、そのAIは相場予測器ではない。きれいな時系列の模倣器だ。模倣器を実弾に出す意味はない。
一方、イレギュラーは別の成績表を持つ。
- その衝撃のあと、市場は何時間で平時に戻るか
- その局面で、規則モデルを止めるべきか
- サイズを落とすべきか
- 見送りが正解だったのか
フォワードテストとは、きれいな系列の延長ではない。規則モデルを走らせながら、イレギュラーが来た瞬間に市場の扱い方を変えるテストだ。
普通のフォワードは「シグナル通りに出したか」しか見ない。マーケットハンドリングのフォワードは「出さない判断」と「小さくする判断」も成績に入れる。
AI時代に新しいのは、予測精度の競争ではない。予測してよい区間と、予測を捨てる区間を分ける運用である。
なぜこれが講師商法の逆側になるのか
「AIに過去を全部学習させれば勝てる」は、売りやすい。データは多い方が賢そうに見える。全部学んだ方が網羅的に聞こえる。
実際は逆だ。全部学ばせると、モデルは衝撃をパターンだと思い込む。あるいは衝撃に負けて、何も学ばない。どちらも商品にはしやすい。検証には使えない。
スマートなAIバックテストは、不親切である。
- このモデルが通用するのは、規則が続いているときに限る
- イレギュラーは当てにいかない
- イレギュラーは、当てる対象ではなく扱う対象だ
この条件書きがある検証だけが、次の時代の検証になる。条件を消して「AIだから勝てる」に戻した瞬間、また講座の話になる。
最後に
TimesFMを否定したいわけではない。規則が続くという前提では、ああいうモデルは使える。使える場所を超えて、衝撃までチャートの形として読ませたときに壊れる。
だからこれからのバックテストは、賢く見せるための学習量競争をやめる。
過去のイレギュラーを抽出する。それを除いたデータで、規則モデルの実力だけを測る。抜いた衝撃は、未来のマーケットハンドリングに使う。
AIに相場の全部を理解させる必要はない。AIに理解させてよい部分と、人間が市場を扱う部分を分ける必要がある。
その分割ができるかどうかが、これからの検証の質になる。
※これは投資助言ではない。手法の宣伝でもない。検証設計の話である。金融商品の取引は元本割れの可能性がある。
きれいな成績だけ見せる検証は、もう見なくていい。見たいのは、何をイレギュラーと判断し、その日にモデルを止めたかだ。
「AIが当たった」より、「AIを使わなかった理由」を書けない手法は、まだ古い。
この記事の続きは、抽出基準と、ハンドリングの分け方だけ書く。勝てる話は書かない。残る話だけ書く。