AIバックテストの多くは、まだ乱暴だ。

過去の価格を全部放り込み、モデルに覚えさせ、成績が良ければ「使える」と言う。

そのやり方は、TimesFMのような時系列基盤モデルでも同じ穴に落ちる。規則的な動きが続く局面では機能する。しかし相場にはランダムな衝撃がかなり混ざっている。その衝撃がノイズになり、モデルを混乱させる。

これから必要なのは、精度を盛る最適化ではない。過去のイレギュラーをできるだけ抽出し、それを除いたデータでバックテストする。抜いたイレギュラーは捨てず、未来のフォワードテストで使う。

僕らは後者を、マーケットハンドリングと呼んでいる。

これが、AI時代の新しいバックテストだ。

古いバックテストが壊れる場所

従来の検証は、一本の時系列を「ひとつの意味」として扱う。

上昇も、指標飛びも、要人発言も、日銀の介入も、流動性の枯れた夜のヒゲも、全部「過去のパターン」にする。AIは優秀なので、その全部から何かを拾う。拾ったものが再現可能な規則だとは限らない。

とくに基盤モデルは、需要予測やアクセス数のような、反復のある系列で強い。季節がある。曜日がある。ある程度、同じ形が戻ってくる。

相場は違う。同じローソク足の形に見えても、中身が違う。

  • ロンドン開始の流れ
  • 雇用統計の初動
  • 地政学の飛び
  • ポジションが一斉に決済されるだけの動き

形は似る。原因は似ない。原因が違うものを同じパターンとして学習させると、モデルは平均的に正しく、局面ごとに壊れる。あるいは、一番安全な答えに逃げる。1本前の価格をずらして出す。グラフはそれっぽい。トレードには使えない。

バックテストが美しいのに、フォワードで死ぬ理由のひとつがここだ。

相場は、規則とイレギュラーの混合物である

スマートな検証は、相場を単一の時系列だと思わない。少なくとも二層に分ける。

規則層
ある程度の持続がある。セッションの特徴、ボラティリティの塊まり、金利差が効いている局面の流れ、レンジとトレンドの切り替えのうち「状態として続く」部分。TimesFMが本来得意なのは、この層に近い。

イレギュラー層
単発の衝撃。指標、要人、介入、破綻、災害、突発的な流動性の消失。過去のチャートの形としては残るが、同じ形が同じ意味で戻ってくる保証はない。

古いAIトレードは、この二層を混ぜたまま「予測」と呼ぶ。新しいバックテストは、混ぜたまま精度を競わない。

規則層でモデルの実力を見る。イレギュラー層は、予測対象ではなく、運用で扱う対象にする。

手順は四つしかない

難しく見せる必要はない。やることは明快だ。

  1. 過去のイレギュラーを、できるだけ抽出する
  2. その影響を除いた系列を作る
  3. その系列だけでAIをバックテストする
  4. 抜いたイレギュラーを、未来のマーケットハンドリングに回す

ポイントは、イレギュラーを「邪魔者として消す」ことではない。検証から除外し、運用には残す。この分け方が、スマートさの本体である。

除去したデータで良い成績が出ても、それで完了ではない。それは「規則が続くなら、このモデルは使える」という条件付きの答えでしかない。相場は条件を守らない。だからフォワードでは、条件が壊れた瞬間を扱う技術が要る。

それがマーケットハンドリングだ。

イレギュラーの抽出は、値動きの掃除ではない

ここを雑にすると、ただの都合のいいデータ加工になる。負けた日をイレギュラーと呼べば、どの手法も勝つ。それは検証ではない。改ざんである。

抽出の基準は、値幅の大きさだけに置かない。原因側に置く。

  • 事前に予定されていた経済指標
  • 中銀と要人の発言
  • 介入、規制、突然の取引停止
  • 明らかなニュースショック
  • スプレッドが異常に開いた時間
  • 平時の流動性が消えた時間帯

「大きく動いたからイレギュラー」ではない。「規則モデルが知るべきでない外部衝撃だからイレギュラー」だ。

除去の仕方も、ローソク足を消して終わり、にはしない。衝撃の区間を印付けし、その寄与を切り離す。残るのは、衝撃がなかった場合に近い規則系列である。完全には取れない。それでも、「全部混ぜて学習する」よりはマシだ。

AI時代に新しいのは、この抽出自体にもモデルを使えることだ。価格だけ見ていた頃より、ニュース、指標カレンダー、出来高、スプレッド、ボラティリティの跳ねを同時に見て、何が規則で何が単発かを分けられる。ただし最終判断は、成績を良くしたい気持ちに渡してはいけない。基準は先に書く。結果を見てからイレギュラーを増やさない。

きれいなデータで見るもの、汚い現実で見るもの

除去後のバックテストで見るべきなのは、勝率の盛られた数字ではない。

  • 規則が続いているとき、モデルは遅延予測に落ちていないか
  • トレンドが続く局面と、レンジが続く局面で、役割が分かれているか
  • コストを入れても、規則層に薄い優位が残るか

ここで落ちるなら、そのAIは相場予測器ではない。きれいな時系列の模倣器だ。模倣器を実弾に出す意味はない。

一方、イレギュラーは別の成績表を持つ。

  • その衝撃のあと、市場は何時間で平時に戻るか
  • その局面で、規則モデルを止めるべきか
  • サイズを落とすべきか
  • 見送りが正解だったのか

フォワードテストとは、きれいな系列の延長ではない。規則モデルを走らせながら、イレギュラーが来た瞬間に市場の扱い方を変えるテストだ。

普通のフォワードは「シグナル通りに出したか」しか見ない。マーケットハンドリングのフォワードは「出さない判断」と「小さくする判断」も成績に入れる。

AI時代に新しいのは、予測精度の競争ではない。予測してよい区間と、予測を捨てる区間を分ける運用である。

なぜこれが講師商法の逆側になるのか

「AIに過去を全部学習させれば勝てる」は、売りやすい。データは多い方が賢そうに見える。全部学んだ方が網羅的に聞こえる。

実際は逆だ。全部学ばせると、モデルは衝撃をパターンだと思い込む。あるいは衝撃に負けて、何も学ばない。どちらも商品にはしやすい。検証には使えない。

スマートなAIバックテストは、不親切である。

  • このモデルが通用するのは、規則が続いているときに限る
  • イレギュラーは当てにいかない
  • イレギュラーは、当てる対象ではなく扱う対象だ

この条件書きがある検証だけが、次の時代の検証になる。条件を消して「AIだから勝てる」に戻した瞬間、また講座の話になる。

最後に

TimesFMを否定したいわけではない。規則が続くという前提では、ああいうモデルは使える。使える場所を超えて、衝撃までチャートの形として読ませたときに壊れる。

だからこれからのバックテストは、賢く見せるための学習量競争をやめる。

過去のイレギュラーを抽出する。それを除いたデータで、規則モデルの実力だけを測る。抜いた衝撃は、未来のマーケットハンドリングに使う。

AIに相場の全部を理解させる必要はない。AIに理解させてよい部分と、人間が市場を扱う部分を分ける必要がある。

その分割ができるかどうかが、これからの検証の質になる。

※これは投資助言ではない。手法の宣伝でもない。検証設計の話である。金融商品の取引は元本割れの可能性がある。


きれいな成績だけ見せる検証は、もう見なくていい。見たいのは、何をイレギュラーと判断し、その日にモデルを止めたかだ。

「AIが当たった」より、「AIを使わなかった理由」を書けない手法は、まだ古い。

この記事の続きは、抽出基準と、ハンドリングの分け方だけ書く。勝てる話は書かない。残る話だけ書く。