AI は SPY に勝てるか — 止めた自動売買を、12 ヶ月の実験として作り直した
「測っているものが設計どおりか」を取り戻すところから、凍結した戦略と AI ディーラー、仮想の SPY で 12 ヶ月をやり直す

はじめに
6 月 15 日の週次レポート(W24)で、Chillarin Trading Lab(以下 CTL)の売買をいったん全部止めたと書きました。あの記事は「練り直す」で終わっていて、その後どうなったのかをまだ書いていません。この記事はその続きです。
先に結論を書きます。
- 6 月の実験は、勝ち負けを測る以前に「何を測っているのか」が崩れていました。問題は大きく 3 つあります。
- 問いを「AI は SPY に勝てるか」の 1 つに絞りました。ルールを凍結した戦略と、毎週判断する AI ディーラーの 2 つを、配当込みの SPY と 12 ヶ月比べる実験に作り直しています。
- 9 月 8 日に今の形で再スタートし、いま 3 週目です。数字は出ていますが、まだ何の結論にもなりません。
- 9 月 26 日に、AI ディーラーの扱いを 1 つ変えました。この記事を書く途中で、マドレーヌが検索を使えないことに気づいたのがきっかけです。売買の判断は AI に任せたまま、判断のための情報や道具は凍結せず、アップグレードしていきます。11 月からは、ニュースを検索できるようにする予定です。
止めてから再スタートまで、ほぼ 3 ヶ月かかりました。
| 時期 | 出来事 |
|---|---|
| 6/1 | 旧プランで運用開始(Fund A = AI、Fund B = テクニカルルール、各 $1,500) |
| 6/11 | 戦略とシステムの根本診断 |
| 6/12 | 新しい実験の骨格(2 つのアーム × 12 ヶ月)を決める |
| 6/14 | 新しい売買エンジンの土台ができる |
| 6/15 | 売買を全停止 |
| 7〜8 月 | 候補の戦略をお金を入れずに並走させながら、本番に向けて仕上げる |
| 8/13 | 旧プランの保有 6 銘柄を売却。確定損益は −$119.54 |
| 8/16 | 戦略の選び方を作り直し、Arm1 の戦略を凍結 |
| 9/1 | 12 ヶ月の起点を宣言 |
| 9/3 | 無人の検証処理が、Arm1 の保有を誤って売る |
| 9/8 | 系列を仕切り直して再スタート(今の 12 ヶ月の起点) |
| 9/25 | 10/2 に銘柄が入れ替われば出ていた不具合を、先に直して本番に入れる |
| 9/26 | AI ディーラーを凍結せず、更新しながら運用する方針に変える |
何が問題だったか
6 月 11 日の時点で、旧プランの成績は Fund A が −1.53%、Fund B が −10.71%、合算で −6.12% でした。同じ期間の SPY は −3.83% です。
ただ、止めた理由は成績ではありません。同じ日に AI に戦略とシステムを根本から診断させたところ、この成績が「何の成績なのか」を説明できないと分かったからです。W24 では診断の指摘を 7 つ紹介しました。ここでは、そのあとの見直しで分かったことも加えて、3 つにまとめ直します。
診断の核にあったのは、この一文です。
「どちらが勝つか」を測る前に、「測っているものが設計どおりか」を回復せよ。
① 問いとプロトコルが無かった
旧プランの問いは「AI の判断と伝統的なテクニカルルール、どちらが勝つか」でした。けれども、私がもともとやりたかったのは「AI が考えた戦略、あるいは AI が常駐して売買することで、SPY を放置するより上回れるか」という実験です。テクニカルルールの Fund B は後から加わったもので、口座で共有していた現金も、週次レビューの手間も、不具合の対応も、多くを Fund B が使っていました。
肝心の Fund A も、「AI の判断」の中身を説明できませんでした。調べると、AI が実際に効いていたのは、ほぼ「毎日の銘柄の絞り込み」だけです。順位づけに使う AI の確信度は、推奨した一部の銘柄を除いて 0.5 の固定値でした。売るタイミングは移動平均線のクロスで決まり、実際には AI は関わっていませんでした。
そして、実験のプロトコルがどこにも書かれていませんでした。何ヶ月観察するのか。何をもって勝ち負けとするのか。どうなったら止めるのか。$1,500 を 2〜3 銘柄に集中させた 1 本の結果では、戦略の差より個別銘柄の運のほうが大きく効きます。判定の基準が無いまま走ると、数週間の優劣で結論を出したくなります。途中でパラメータを触り続けて、実験が「いつまでも途中経過」になる危険もありました。
② バックテストした戦略と、本番で動いていた戦略が別物だった
いちばん大きな見落としはこれでした。
Fund A のバックテスト(+230%)は、固定した大型株 22 銘柄の中から、値動きの勢いが上位の 2 銘柄を選ぶ前提でした。本番では、AI のスクリーナーが毎日 30 銘柄を選び直し、その中から上位 2 銘柄を選んでいました。Fund B のバックテストは 22 銘柄・5 年間で買いが 27 回でしたが、本番は S&P 500 の全 503 銘柄が対象で、1 日に 13〜15 の候補が出ていました。
つまり本番で動いていたのは、どちらも「検証した戦略」ではありません。勝っても負けても、それが何の証拠なのか言えない状態でした。
Fund A の +230% という数字そのものにも問題がありました。2026 年まで生き残った勝ち組の銘柄を、2021 年から持っていた前提の数字です。同じ 22 銘柄を等分に持つだけでも +175% になります。SPY に対する上乗せの過半は、戦略ではなく銘柄の選び方(後から見た勝者)から来ていた疑いが濃い、というのが診断の見立てでした。
③ 計器が静かに嘘をついていた
3 つ目は、成績を記録する側の問題です。6 月の診断で分かったものと、そのあとの見直しで分かったものがあります。どれもエラーや警告を出さずに、数字だけを歪めていました。
- 約定が自己申告だった。 注文が受け付けられた時点で「約定済み」とし、価格も発注時に決めた上限(ガード価格)で記録していました。記録上の成績が、証券会社で実際に起きたことと一致する保証はありませんでした。
- 弾かれた注文が記録に残らなかった。 Fund B の買い注文は、口座の買付余力が足りずに 34 回続けて弾かれていました。通ったのは、そのとき残っていた余力で買える安い候補だけです。しかも弾かれた記録はデータベースに一切残らず、注文の一覧だけ見ると平穏に見えていました。
- 比べる相手の SPY が配当抜きだった。 株価だけの系列で比べていたので、SPY を年 1.2〜1.5% ほど低く見積もっていました(診断の翌日、新しい実験を設計する中で指摘されたものです)。
- 手数料の計算式が 4 か月間まちがっていた。 台帳に書いていたのは証券会社の請求額ではなく、自分の計算式の出力でした。小口の注文ほど外れが大きく、最大で実際の 14.5 倍に見積もっていました。これは止めたあと、8 月 13 日の監査で分かったことです。6/4 の記事に書いた「手数料 $2.11」もこの式の値で、実際の料率で計算し直すと約 $0.96 でした。
診断はこの状態を「壊れているのは工学ではなく科学の方」とまとめていました。不具合を 1 つずつ直す仕組みは回っていたのに、実験の設計そのものが崩れていた、という意味です。このまま走らせても結果に意味が出ないので、止めて作り直すことにしました。
何に切り替えたか
問いを 1 つにする
新しい問いは「AI は SPY に勝てるか」です。ただ、この問いには性格の違う 2 つの仮説が混ざっていました。
- AI が関わって決めたルールを凍結し、そのとおりに売買すれば SPY に勝てるか
- AI が常駐して、その都度判断すれば SPY に勝てるか
前者はバックテストができます。後者は AI の過去の判断を再現できないので、前に進みながら観測するしかありません。検証の仕方が違うので、別々のアームに分けました。
| 旧プラン(6/1〜6/15) | 新しい実験(9/8〜) | |
|---|---|---|
| 問い | AI とテクニカルルール、どちらが勝つか | AI は SPY に勝てるか |
| 走らせるもの | Fund A(AI)/ Fund B(テクニカルルール) | Arm1(凍結した戦略)/ Arm2(AI ディーラー) |
| 資金 | 各 $1,500 | 各 $1,500 |
| 比べる相手 | インデックス放置(配当抜き) | SPY(配当込み・お金を入れない仮想の系列) |
| 期間と判定 | 決めていなかった | 12 ヶ月。勝ち負けの判定は 12 ヶ月後の 1 回だけ |
| バックテストと本番 | 別のコード・別の銘柄群 | 同じコードを通す |
安全策を置かない
最初の設計案には、3 つ目のアームとして「SPY を実際の資金で持つ」枠がありました。万一に備えた安全策です。これは同じ日のうちに撤回しました。
この口座は、私の資産全体から見ると外側の「サテライト」です。家計の中核の資産は、別にインデックスで持っています。その外側の口座の中にさらに SPY を置くのは、入れ子になった意味のない安全策でした。しかも「このお金も SPY に入れておくべきだったか」はこの実験の問いそのものなので、SPY はお金を入れない仮想の系列で測れば足ります。
AI の設計案に対して、そのとき私が返した言葉が記録に残っています。
中途半端な安全策に逃げるな
この日から、実験のミッションは「サテライトの資金として最大のリターンを狙い、見ていて面白いものにする」になりました。インデックスに負けるのを恐れて中庸に寄せるのは禁止です。リスクの歯止めは「一発で破滅しないこと」と「桁を間違えたような誤発注を止めること」に限り、途中の値下がりで縮こまる仕組みは置いていません(前者のための −50% 停止は、まだ仕組みになっていません。後述)。
Arm1 — ルールを凍結した戦略 v3_hold
Arm1 は、決めたルールのとおりに売買するだけの戦略です。中身は単純です。
- 対象は米国の大型株 15 銘柄に固定する
- 過去 126 営業日(約半年)の値上がり率が上位の 2 銘柄を、同じ金額ずつ持つ
- 入れ替えは月に 1 回、月初だけ
- 持っている銘柄は、50 日の移動平均(EMA)が 200 日を下回ったら売る
- レバレッジ型の ETF は使わない。損切りの注文も置かない
銘柄を 15 に固定したのは、旧プランの「毎日銘柄が入れ替わるせいで、バックテストと本番が別物になる」を仕組みの側から断つためです。銘柄の入れ替えもパラメータの変更とみなし、変えたら 12 ヶ月を最初から数え直すルールにしました。
この戦略をどう選んだかは次の節で書きます。「AI が設計した戦略」とは呼べない事情があります。
Arm2 — AI ディーラー「マドレーヌ」
Arm2 は、AI が週に 1 度判断して売買するアームです。7 月に「マドレーヌ」と名前を付けました。
- 判断に使うモデルは、始めた時点では Claude の Opus 5 に指定して固定しました。下位のモデルを選ぶと、負けたときに「モデルの選び方のせいだ」という言い逃れの余地を自分で作ってしまうからです(この固定は 9/26 にやめました。後述)。
- 売買してよいのは、決めておいた 39 銘柄です(大型株 13 と ETF 26。ETF にはレバレッジ型やインバース型も入っています)。1 銘柄への集中も、現金の比率も自由です。
- 縛りは「売買できる範囲」「売買を含む判断は月 6 回まで」「誤発注の防止」の 3 つだけです。何もしない判断は回数に数えません。相場が大きく動いた日には臨時の判断も入りますが、そのきっかけの判定に AI は関わりません。
- 見せる情報は、値動きと、保有・現金・これまでの手数料といった口座の状態だけです。ニュースも決算日も渡していません。
- 判断のたびに(何もしないと決めたときも)、理由と、どうなったらこの判断は間違いだったと認めるかを書かせて、すべて記録しています。集中して張るなら、なぜ今か、なぜこのサイズか、どこで降りるかを言葉にさせます。集中度や現金の比率に上限を置かない代わりに、理由を書かせて残す設計です(書いたとおりに動いたかを判定する仕組みはまだありません。後述)。
SPY — お金を入れない物差し
SPY は、配当を再投資した前提(トータルリターン)で計算した仮想の系列です。SPY にはお金を 1 ドルも入れていません。
12 ヶ月のルール
- 期間は 12 ヶ月。勝ち負けの判定は 12 ヶ月後に 1 回だけ行い、途中の記録では優劣の結論を出さない
- 凍結したルールやプロンプトを変えたら、系列をリセットして別の系列として数え直す。ただし Arm2 のモデル・道具・プロンプトの変更は、9/26 から系列を切らない扱いにしました(後述)
- どちらかのアームが起点から −50% に達したら、そのアームを止めて原因を調べ、作り直してから再開する。ただし、この停止はまだ仕組みになっていません。検索を入れる前に実装すると決めています(検索は 11 月初めの予定)
- 事前の予想も書いておく。過去の傾向から見れば、12 ヶ月で両アームとも SPY に負ける確率のほうが高い。負けても実験としては成功で、AI の判断の記録そのものが成果物になる
バックテストと本番が同じコードを通る
売買エンジンは、旧エンジンへの継ぎ足しをやめて一から作り直しました(real2 と呼んでいます)。いちばんの原則は、戦略を 1 つの関数にして、バックテストと本番の両方がその同じ関数を呼ぶことです。同じ入力なら、同じ注文が出ます。
ほかにも、旧プランで踏んだ罠に合わせて次のことを決めました。
- 口座の状態は毎回証券会社に問い合わせて作り直す。受け付けただけの注文を約定扱いにしない
- 発注しなかった理由も記録する
- 何も起きなかった日も「正常」と 1 行知らせる。黙っているのが正常なのか故障なのか、区別がつくようにする
9/26 の変更 — マドレーヌは進化させていく
この記事を書くために、マドレーヌの判断の記録を読み返していて、1 つ気になりました。9/14 の判断の説明に、こう書いてあったのです。
見えているのは価格とモメンタム(過去21日・126日の騰落率)だけ。ニュースも決算日も気配も、このブリーフには一切ありません。
確かめると、マドレーヌは検索もほかの道具も使えない設定になっていました。8 月にニュースなどの分析を渡す仕組みを試しましたが、無人では安定して動かず、価格だけを渡す形のまま凍結していたためです。
そこで、Arm2 の扱いを変えることにしました。売買の判断は、これからもあくまで AI に任せます。変えるのは、その周りです。AI のモデルも進化していくので、始めたときの構成をずっと凍結し続けるのではなく、AI が判断しやすくなるよう情報を渡す仕組みや道具を、アップグレードしていきます。モデルやプロンプトの更新も含みます。今回はその最初として、マドレーヌにニュースの検索機能を足すことにしました。
ただし、変え方には決まりを置きます。
- モデル・道具・プロンプトを変えても、成績の系列は切らない。変更した日・中身・理由を版として記録し、成績の記録に注記する(見せ方はこれから決めます)
- 変更を入れるのは月初だけ。入れる前に中身と理由を記録し、「直近の成績が悪いから」を理由にしない
- 安全に関わる変更は、発注しない試運転を通してから入れる
売買してよい銘柄の範囲や月の判断回数の上限(封筒)を変える場合は、これまでどおり系列をリセットします。Arm1 も変えません。ルールを変えたら系列をリセットする、元の決まりのままです。
検索を使えるようにするのは、11 月初めの予定です。価格だけで判断するマドレーヌもペーパー(仮想売買)で並走させ、同じ時期の判断を比べる予定です。検索が使えない週は判断しない設計にします。ただし、ペーパーと実際の資金では約定の条件が違い、判断の数も年に数十回と少ないので、比べて言えることは限られます。
その代わり、12 ヶ月後に Arm2 について言えることは「モデルとプロンプトを固定した AI が SPY に勝ったか」ではなく、「更新しながら運用した AI ディーラーが SPY に勝ったか」になります。どの版が効いたのかは、切り分けにくくなります。
戦略の選び直し
Arm1 の戦略は、最初から v3_hold だったわけではありません。
6 月 14 日、候補の戦略をバックテストで比べる前に、「どうやって選ぶか」の基準を書いて固定しました。結果を見てから都合のよい基準を選ばないための事前登録です。候補は 4 つありました。AI が設計した攻めの戦略が 3 つと、旧 Fund A の戦略をバックテストと本番で同じ動きになるよう直した v3_hold です。v3_hold はもともと、比べるための対照として置いた候補でした。
この基準で選ばれたのは lev_trend でした。3 倍レバレッジの ETF を使うトレンドフォローで、損切りの仕組みはありません。7 月に候補をお金を入れずに並走させると、lev_trend は SPY から大きく遅れました。週次レビューも 7 月の 4 週続けて、このまま始めることに反対しています。
8 月に見直すと、選ぶ手続きそのものに欠陥がありました。
- 順位を決める物差しが「学習期間の年率リターン」1 つだけで、検証期間の成績が順位に効いていなかった
- 差が小さいときに検証期間の成績で比べる仕組みはあったが、条件が狭すぎて一度も働いていなかった
- 検証期間は「2022 年」のはずが、実際には 2021 年 6 月から取引していた
その結果、「学習期間に最もよく合わせ込んだ候補が、機械的に選ばれる」手続きになっていました。lev_trend は、学習期間のリターンが最も高く、当時の検証期間では、失格しなかった候補の中で唯一マイナスでした。
8 月 16 日、選ぶ基準を作り直しました。
- 検証期間の最大下落が深すぎる候補は外す
- 検証期間にきちんと取引していない候補は「測れていない」として、第一候補にしない
- 相場の悪い年(2022 年)にリターンがプラスでなければ、第一候補にしない
- 順位はまず検証期間の成績で決め、学習期間の成績は最後の同点決めにしか使わない
あわせて「特定の候補が 1 位になるように閾値を動かさない」「都合のよい期間を後から選ばない」という禁止事項も書きました。手数料も実測の率で計算し直しています。選び直した結果がこれです。
| 候補 | 2022 年のリターン | 判定 |
|---|---|---|
| v3_hold | +1.6% | 第一候補(2022 年がプラスだった唯一の候補) |
| momentum_top1 | −8.8% | 予備 |
| lev_trend | −45.3% | 予備 |
| regime_switch | −61.2% | 失格 |
検証期間の区切りを 7 通りずらして試すと、7 通りすべてでリターンがプラスだったのは v3_hold だけでした(そのうち 1 通りは +0.03% で、ほぼゼロです)。momentum_top1 は 5 通り、lev_trend は 1 通りでしかプラスになりません。古い基準のままだと、手数料や期間を直した 4 通りのどれでも lev_trend が選ばれます。答えを変えたのは、選ぶルールのほうでした。
凍結を決めたのは私で、AI は推奨を出しただけです。v3_hold になったことで、週次レビューが反対していた主な理由(損切りの無い 3 倍レバレッジ)は論点ごと消えました。
ここで Arm1 の問いも読み替えています。凍結したのは AI が発明した戦略ではなく、もとは対照だった v3_hold です。AI が設計した攻めの 3 候補は、相場の悪い年に全部落ちました。なので Arm1 の問いは「AI が設計した戦略は SPY に勝つか」ではなく、「AI が事前に登録した選び方で選ばれた戦略は SPY に勝つか」になります。AI の役割は、戦略を発明することから、選ぶ手続きを作ることに移りました。この読み替えは起点より前に済ませています。結果を見てから問いを書き換えると、後知恵になるからです。
念のため書いておくと、選んだのは「SPY に勝つ戦略」ではありません。候補をお金を入れずに 6 週間走らせた時点では、4 候補とも SPY に負けていました。選んだのは、12 ヶ月観察する対象です。
始めてからの 3 週間
起点が何度も動いた
12 ヶ月の起点は、はじめ 8 月 17 日の予定でした。
- 8/16、選び方の欠陥を直すために 8/25 へ延期しました。その 2 日前の点検でも「本番で発注するコードがまだ無い」と出ていました
- 8/25 は見送りました。本番の記録の出どころが実際の口座ではなく、過去データの再生になってしまう問題が残っていたからです。12 ヶ月分の Arm1 の記録が、初日から最後までバックテストの値になるところでした
- 8/31 は当日に着手できず、9/1 に動かしました
「『もう 1 週間あれば正しくできる』は放置すると次の週も同じことを言う」として、日程を動かさない約束も書いていました。それでも起点は 3 回動いています。そのうち 2 回は、欠陥を抱えたまま 12 ヶ月の 1 行目を刻まないための延期でした。
9/3 の事故
9 月 2 日、Arm1 は最初の売買で AMD と UNH を 2 株ずつ買いました。翌日の 9 月 3 日、引け前 15 分の売買の条件を実測するために無人で動かしていた検証用の処理が、その 4 株を実際の資金で売ってしまいます。
原因は、アームの持ち分と口座全体の持ち分を区別していなかったことです。検証処理は後片付けで「自分の持ち分」を売るつもりで、口座にある株を全部売りました。しかも、その手前で安全装置が発注を止めた合図を出していたのに、それを見ずに売りへ進んでいます。無人で動いたのはこの日が初めてで、当日の監視はすべて緑でした。
金額の損失は $4.62 で、そのほとんどは手数料です。実験として痛かったのは、9 月の保有を失ったことでした。事故のあと、どのアームの持ち分かは注文の台帳で決めるようにしました。毎回「口座の中身 = 全アームの台帳の合計」を確かめ、合わなければ両アームとも発注を止めます。売る処理は、自分のアームの持ち分しか売りません。
9/8 の仕切り直し
事故のあと、AI の推奨は「何もせず 10/2 の月初から再開し、9 月は事故の月として正直に残す」でした。私はこれを退けて、系列ごと仕切り直すことにしました(9/7)。
- Arm1 は 9/8 に買い直す。凍結ルールでは入口は月初しか開かないので、1 回だけ人の手で入口を開ける。ただし銘柄・金額の配分・株数は凍結ルールのまま
- Arm2 も実際の資金にする
- 両アームとも $1,500 にそろえ、9/8 を新しい起点にする。12 ヶ月の終わりは 2027 年 9 月 8 日
Arm2 は 8 月の時点では「12 ヶ月ペーパー(仮想売買)で測る」と決めていました。起点の直前に、まだ試していない発注の経路を有効にするのは危ないからです。それを上書きしたときの私の言葉として、記録に残っているのはこの一言です。
ペーパーでは面白くない
仕切り直しで失ったものもあります。9/1〜9/4 の記録は、12 ヶ月の系列から外れました。「凍結したルールに 12 ヶ月手を触れない」という純度も、9/8 の人の介入で崩れています(系列には印を付けて残しています)。事故の損失と、検証処理が TQQQ を往復売買した損失(合わせて $6.64)は、仕切り直しで 12 ヶ月の成績の外に出ました。
その代わりに、1 つ約束を書きました。将来、運用の事故が実験に有利に働いた場合も、同じ手順で元に戻します。不利な事故だけを直すことにならないようにするためです。
9/8 の買い直しでは、AMD と UNH を 1 株ずつ買いました。AMD は、判断に使った価格から約定まで +5.68% ずれています。今の系列(9/8〜)では、凍結した戦略が自分の判断で買った回数は、まだ 0 回です。
10/2 に銘柄が入れ替われば出ていた不具合を、先に直した
9 月 19 日の週次レビューで、10/2 の月初に銘柄が入れ替わると問題が起きることが分かりました。
v3_hold は入れ替えのとき、売る銘柄の代金を予算に足して、買う株数を決めます。ところが発注の直前にある安全チェックは、売った代金を足さずに「今ある現金」だけで検算し、はみ出した買い注文を全部弾く作りでした。バックテストのほうは代金を戻して計算するので、ここでもバックテストと本番の挙動がずれていました。
放っておくと、1 銘柄だけ入れ替わる月は、買う銘柄の値段によっては売りだけが通り、Arm1 は資産の約 65% を現金のまま 1 ヶ月過ごします。しかも、どの監視にも映りません。処理は正常に終わり、画面は緑のままです。この経路は、それまで一度も実行されていませんでした。9/8 は現金からの買いだけ、9/3 は売りだけだったからです。
直し方はこうです。まず売りを出して約定を確かめます。約定した分の代金(約定価格 × 約定した株数 − 手数料)だけを足してから、買いを検算します。約定していない売りの代金は足しません。凍結した戦略には手を触れていません。安全チェックが注文を弾いたときは、失敗として通知に出るようにしました。入れ替えの無い月初に「戦略が動いていない」と誤って鳴る監視も、あわせて直しています。修正は 9 月 25 日に本番へ入れました。
ただ、この修正は本番ではまだ一度も試されていません。9/24 の終値で試算すると、10/2 は入れ替えなしの見込みです。とはいえ 2 位の UNH と 3〜4 位の銘柄の差は小さく、入れ替わる可能性も残っています。
今の数字
9/23 の終値まで
| 評価額 | 起点比 | 同じ期間の SPY | |
|---|---|---|---|
| Arm1(凍結した戦略 v3_hold) | $1,578.19 | +5.21% | +0.49% |
| Arm2(AI ディーラー) | $1,581.83 | +5.46% | +0.49% |
どちらも 9/8 に $1,500 から始めています。SPY は 9/8 の終値から 9/23 の終値までの配当込みの値です。
読むときの前提を 4 つ書いておきます。
- まだ 12 ヶ月のうちの 2 週半です。 売った取引は 0 件で、勝率もまだ出せません。9/19 の週次レビューでも、両方のレビュアーが「実力ではない」で一致しています。
- Arm1 は整数の株数でしか買わないので、資産の約 38%($592.29)が現金で残っています。 上げ相場では不利に、下げ相場では有利に働きます。
- アーム側には配当が入らず、SPY は配当込みです。 この比べ方は、常に SPY に有利な向きに偏っています。
- ダッシュボードの日付は、価格の日付より 1 営業日先の表記です。 売買は米国時間の 15:45、終値が決まる前に動くためです。表の「9/23 の終値」は、ダッシュボードでは 9/24 の行にあたります。
マドレーヌは、なぜその判断をしたのか
9/8 に仕切り直してからの今の系列で、Arm2 は 2 回判断しています(それより前のペーパーの期間にも判断はありましたが、この 12 ヶ月の系列の外です)。
| 判断日 | 中身 | 確信度 |
|---|---|---|
| 9/14 | AAPL を 2 株、META を 1 株買う(計画では資金の約 87.5% を投資、レバレッジなし) | 0.56 |
| 9/21 | 何もしない | 0.62 |
判断のたびに、マドレーヌの応答から次の 3 つを取り出して、データベースに全文を残しています。何もしないと決めたときも同じです。
- 判断全体の説明(9/14 は約 980 字、9/21 は約 890 字)。空なら判断として受け付けません
- どうなったらこの判断は間違いだったと認めるか。これも空なら受け付けません
- 注文ごとの理由(「何もしない」という注文の理由も含む)。出力の形式で求めていますが必須にはしておらず、空なら「llm」という仮の文字が入ります。2 回とも、すべての注文に理由が書かれていました
判断のときに見せた情報(以下、ブリーフ)も、全文を保存しています。中身は、売買してよい 39 銘柄の一覧、そのうち 18 銘柄の価格と過去 21 営業日・126 営業日(約 1 ヶ月・約半年)の値動き、口座の保有と現金、これまでの手数料、今月すでに使った判断の回数と月の上限(6 回)です。ブリーフの全文から計算したハッシュ値で、判断の記録と結び付けています。以下に引くマドレーヌの言葉は、すべてこの記録の原文です。引用の中の「封筒」は、マドレーヌが売買してよい範囲のことです。
9/14 — AAPL を 2 株、META を 1 株買った
最初の段落で、SPY を買わない理由をこう書いています。
ここで「とりあえずSPY」を買うなら私は不要なので、SPYに勝つための形を作ります。
続けて、見えている情報から使える手がかりを 1 つに絞っています。
見えているのは価格とモメンタム(過去21日・126日の騰落率)だけ。ニュースも決算日も気配も、このブリーフには一切ありません。だから私が使えるエッジは一つだけ——『指数が下を向いている局面で、それでも上を向いている銘柄』という相対強さです。
前に書いた 9/26 の変更は、この一文を読み返したことがきっかけでした。
この日のブリーフでは、SPY・QQQ・TQQQ の過去 21 日の値動きがどれもマイナスでした(−1.06%・−1.22%・−4.85%)。その中で選んだ 2 銘柄と、残した現金の理由を、注文ごとにこう書いています。
| 注文 | 注文ごとの理由(原文) |
|---|---|
| AAPL を 2 株買う | 21日+9.9%/126日+30.2%と短期・中期の両方で上向き。指数がマイナスの中での相対強さを買う |
| META を 1 株買う | 21日+12.0%と封筒内トップの短期モメンタム。126日が+1.7%と低いのは出遅れ反転の初動と解釈 |
| 何もしない(残りの現金) | 残り約187ドルは端数のため現金のまま保持 |
2 銘柄に分けたのは「この二つは性格が違うので、同じ「強さ」でも壊れ方が別々になるはずです」という理由でした。
買わなかったものにも、それぞれ理由を書いています。AMD は 126 日で +161% と伸びていましたが、同じ半導体の AVGO(21 日で −12.99%)と NVDA(同 −2.48%)が崩れていて「セクターとして揃っていない」こと、1 銘柄だけ突出して伸びた後に買うには、1 株 $516(口座の 34%)では「ロットが粗すぎる」ことを挙げています(同じ日に買った META は 1 株 $648 で、口座の 43% にあたります)。レバレッジ型の ETF(TECL・TQQQ)は「指数のモメンタムが上向いてから使う道具で、今は減価(値動きの往復で価値が削られる性質)を払うだけ」としています。値下がりで儲かるインバース型(SQQQ・SPXU)には、こう書いています。
逆張りのSQQQ/SPXUも、私は『指数が下がる』という予想を持っていないので触りません。持っていない意見でポジションは取らない。
投じたのは計画で $1,312.57、資金の約 87.5% です。全額を入れなかった理由を、判断全体の説明ではこう書いています。
理由は、これが月6回の判断予算のうち1回目だからです。市場がまだ方向を決めていない局面で全弾撃つのは下手な設計で、下がったところで買い増す権利、あるいは間違いを認めて切る余地を残しておきたい。集中はしますが、一発勝負にはしません。
一方、同じ判断の注文ごとの理由では、残りの約 $187 を「端数のため現金のまま保持」としています。この食い違いは後で書きます。
降り方の前提は「私が買っているのは『相対的な強さ』であって、企業のストーリーではありません」です。そのうえで、間違いを認める条件を 3 つ書いています。
- 20 営業日以内に AAPL が終値で $299 を割ったら、AAPL の判断は間違いだったと認めて、次の判断で全量を売る
- 同じく META が終値で $583 を割ったら、META の判断は間違いだったと認めて、次の判断で全量を売る
- 20 営業日後の時点で、AAPL と META の 21 日の値動きがそろってマイナスで、同じ時点の SPY の 21 日の値動きがプラスなら、「指数より強い銘柄を選んだ」という前提そのものが崩れたとして、2 銘柄とも手放す
$299 と $583 は、判断のときに見ていた価格(AAPL $332.27、META $648.03)から約 −10% の水準です。実際の約定は AAPL $333.97、META $666.60 だったので、実際の買値から見ると META は約 −12.5% にあたります。
9/21 — 何もしなかった
2 回目は、買うか売るかより先に、手元の数字を並べています。
今週は動かない。理由は在庫と財布の中身を並べれば一目で分かる。口座1,502ドルのうち約89%はAAPL2株とMETA1株、残りは現金163.69ドル。
マドレーヌは、この現金で買えてブリーフに価格が載っているのは TQQQ の 2 株($145.28)だけだと書いています。実際のブリーフでは、ほかにも WMT・NFLX・SQQQ が同じ現金で買える値段でした(後述)。AMD は 1 株 $560 で手が届かず、SOXL と TECL はブリーフに価格が載っていなかったので、「見えていないものは売買しない」として外しています。TQQQ を買わなかった理由は、注文ごとの理由にこう書いています。
現金163.69ドルで買える封筒内の値付き銘柄はTQQQ2株のみ。既存のAAPL+METAと相関が高く、指数の1ヶ月モメンタムが横ばい〜マイナスの局面でレバレッジETFを足すのは期待値が薄い。
判断全体の説明では、これを 2 つに分けています。1 つは、資産の 9 割がすでに AAPL と META という大型テックにあり、そこに 3 倍レバレッジのナスダックを足すのは「分散」ではなく「同じ賭けの厚塗り」だ、という理由です。もう 1 つは、横ばいで行ったり来たりする相場では、レバレッジ型の ETF は値動きの往復で目減りする、という理由です。期待できる上積みはマドレーヌ自身の見積もりで「うまくいって口座の0.5〜1%程度」とし、「判断予算1回とリスクの上積みに見合わない」と結論しています。
持っている 2 銘柄も売りませんでした。META は、手数料込みの平均取得単価 $667.48 に対して、ブリーフの価格(前営業日の終値)が $665.75 でした。マドレーヌは「私は上げの終盤で乗った」と認め、高値づかみの疑いも自覚していると書いたうえで、こう続けています。
それでも切らないのは、モメンタムが折れた証拠がまだ1つも出ていないからだ。折れてから切る。予感で切らない。
残した現金(約 11%)は「次に本当のエッジが見えた時の弾薬だ」としています。何もしない判断は月 6 回の枠を使わないので、残りの 5 回は「値段の見える良い球が来た時のために取っておく」としています。その 2 つの文のあいだには「何かしたいから買う、は理由ではない」という一文があります。これはプロンプトに書いた判断の規律(後述)を、ほぼそのまま言い直したものです。
間違いだった条件は 3 つです。10 営業日以内に次のどれかが起きたら、この判断は間違いだった、としています。
- SPY の下げが 3% 未満なのに、META が $600 か AAPL が $310 を終値で割る(市場全体ではなく、個別の要因で崩れたのに放置した)
- QQQ が 721.45 から 5% 以上上がって終わり、現金を遊ばせた機会損失が口座の 1% を超える
- SPY が 761.69 から 3% 以上下げる局面で、2 銘柄が SPY より悪くなる(集中した対価を払っただけ)
9/14 と違って、そうなったときに何をするかは書いていません。
この記録について、書いておくこと
ここに引いた理由は、マドレーヌが判断と同じ応答の中で書いた説明です。しかもプロンプトで、次のように伝えたうえで書かせています。
あなたの判断・理由・反証条件は全件ジャーナルに記録され、週次「AI ディーラーの言い分」としてブログで公開される。読者は素人も含む。負けた週ほど正直に、面白く。
プロンプトには、判断の規律も 6 つ書いてあります。そのうち次の 5 つは、ここまでに引いた説明にそのまま表れています。ブリーフに無い情報(ニュース・決算日・気配)を知っているかのように仮定しない。「何かしたい」は取引の理由ではない。集中するなら「なぜ今、なぜこのサイズ、どこで降りるか」を言葉にする。レバレッジ型やインバース型の ETF は減価を意識する。間違いの条件は「○○が N 営業日以内に□□を割り込んだら、この判断は間違いだった」の形で書く。9/14 の「ニュースも決算日も気配も、このブリーフには一切ありません」や、9/21 の「何かしたいから買う、は理由ではない」は、この規律をほぼそのまま言い直したものです。
実際には、週次の公開はまだ一度もしていません。2 回分の理由を公開するのは、この記事が初めてです。いずれにしても、これは読者に向けて書かれた説明で、AI の内部の思考過程を記録したものではありません。書かれた理由どおりに判断したのかは、原理的に確かめられません。
確かめられるのは、説明が、見せた情報と合っているかまでです。価格と値動きの数字は、2 回分とも保存済みのブリーフとすべて一致しました。ただ、ブリーフの数字や銘柄の一覧と照らすと、裏付けられない説明が少なくとも 4 つありました。
- 9/21 の「買える封筒内の値付き銘柄はTQQQ2株のみ」。 同じブリーフで、WMT($106.73)は 1 株、NFLX($71.79)は 2 株、SQQQ($37.87)は 4 株、現金 $163.69 で買える値段でした。3 つとも売買してよい銘柄の一覧に入っています。TQQQ を見送った理由は書いていますが、この 3 つには説明の中で触れていません
- 9/14 の SOXL・SOXS(半導体の 3 倍・逆 3 倍)の見送り。 AMD と「同じ理由で見送り」としていますが、この日のブリーフに 2 つの価格は入っていませんでした(売買してよい銘柄の一覧に名前があっただけです)。AMD を見送った理由の片方は 1 株の値段なので、価格を見ずには言えないはずです。9/21 の説明では、SOXL と TECL について「ブリーフに価格が載っていない」と正しく書いています
- 9/14 の「全弾撃つのは下手な設計」。 投じる額を約 87.5% に抑えた理由の 1 つに「下がったところで買い増す権利」を挙げています。けれども、この日の価格では AAPL 2 株と META 1 株が、この 2 銘柄を両方持つ組み合わせの上限でした(AAPL をもう 1 株足すと $1,644.84 で資金を超えます)。残った約 $187 では、AAPL も META も 1 株も買えません。AAPL も META も買い足せない残り、という意味では、注文ごとの理由の「端数のため現金のまま保持」のほうがブリーフの数字と合います
- 9/14 の AAPL の位置づけ。 「短期と中期が揃って上を向いている封筒内で唯一に近い銘柄」としていますが、その日のブリーフでは AMD・META・MSFT も、21 日と 126 日の値動きが両方プラスでした。同じ日の META の「封筒内トップの短期モメンタム」は、価格が見えている 18 銘柄の中では正しいものの、残りの 21 銘柄の値動きはブリーフに無いので、売買してよい範囲全体で一番かどうかは分かりません。9/21 の META の「封筒内で最強クラスの勢い」も同じです
間違いを認める条件は、マドレーヌ自身の宣言です。条件に当たったかを判定する仕組みも、当たったら自動で売る仕組みもありません。次の判断のブリーフにも、過去の宣言は載せていません。
判断の記録として残していないものもあります。AI の応答の生のテキストと、判断 1 回ごとの費用・トークン数です。判断の記録に残しているのは、応答の本文から取り出した項目(説明、注文とその理由、条件、確信度)です。応答が申告したモデル名などの付帯情報は、別の観測ログに、ブリーフのハッシュ値付きで残しています。確信度の 0.56 と 0.62 は、何を表す数字かをプロンプトで決めていないので、確率としては読めません。
正直な限界
12 ヶ月後に結果を読むときも、次の限界を外して読むことはできません。
| 限界 | 中身 |
|---|---|
| 銘柄の選び方の偏り | Arm1 の 15 銘柄は、2026 年の時点で生き残っている大型株から選んでいます。後から監査すると、学習期間の成績では、無作為に選んだ 15 銘柄の組み合わせ 200 通りの中で上位 5% に入っていました(検証期間のシャープレシオでは中位)。無作為の 15 銘柄だった場合、今の選び方で v3_hold が選ばれるのは 19% ほどです。後知恵で選んだとまでは言えませんが、有利な集合である可能性は残ります |
| 見分ける力が弱い | 検証期間は 2022 年の 1 本だけです。候補の順位に統計的な意味は無く、言えるのは「相場の悪い年に損をしなかったのが v3_hold だけだった」までです |
| 被験体が動く | Arm2 は Claude Code の CLI 経由で呼んでいて、CLI の版は固定せず、自動更新のままにしています。初回の判断の記録では、応答が申告したモデルに、指定した Opus 5 と並んで Haiku 4.5 が入っていました。同じ呼び出しの中で Claude Code が補助に使ったもので、本文をどちらのモデルが書いたかまでは記録から分かりません。モデルの振る舞いが途中で変わったかどうかは、この実験では測っていません。9/26 からは意図して更新していく方針なので、12 ヶ月後の Arm2 の成績を、特定の版の実力として読むこともできません |
| 見えているのは価格だけ | 9/8 から 11 月初めまでのマドレーヌには、ニュースも決算日も見えていません(11 月から検索を持たせる予定です) |
| 人の介入 | 9/8 の入口は、凍結ルールの外にある人の介入です |
| 約定のずれ | バックテストは当日の終値で約定する前提ですが、本番は判断した価格から約定までずれます(9/8 の AMD は +5.68%)。このずれを測る指標は、9/25 の修正で足したばかりです |
これから
- 米国時間 10/2(金) — 今の系列で、凍結した戦略が初めて自分で判定する月初です。銘柄が入れ替われば、9/25 に入れた修正が本番で初めて試されます。入れ替わらなければ、誤報を直した監視のほうが試されます。
- 11 月初め — マドレーヌにニュースを検索させる予定です。価格だけのマドレーヌはペーパーで並走させる予定です。変更の中身と理由は、入れる前に記録します。
- 毎週 — 週次レビューで、約定のずれや判断の記録の抜けといったプロセスを確かめます。成績の優劣の結論は出しません。
- 2027 年 9 月 8 日 — 12 ヶ月の判定です。勝ち負けの結論は、ここで初めて出します。
それまで、Arm1 の凍結したルールは、数字が良くても悪くても変えません。Arm2 は更新していきますが、変更は月初だけにし、中身と理由を先に記録します。
関連記事
- 止めた週の記録 — 【週次レポート】売買をいったん止めて練り直すことにしたりん!2026-W24。診断の 7 つの指摘と、止めると決めた経緯です。
- 旧プランの始まり — 米国株 $3,000 を AI とテクニカルルールで動かす — Chillarin Trading Lab を始めた。
- 旧プランの仕組みと売買ルール — Chillarin Trading Lab の仕組み — AI 自動売買の全体像 と Chillarin Trading Lab 売買シグナル解説。どちらも旧実験の解説です。
- 計器が嘘をついた最初の例 — 再起動したら資産が2倍に増えてた — システムのよくある罠にハマった話 と 資産2倍バグのその後 — 再起動が暴いた5つの不具合を直す。
- 今の成績 — 両アームと SPY の推移は Chillarin Trading Lab のダッシュボード で見られます。
注記
- この記事は投資助言ではありません。個人が自分の少額資金で行っている実験の記録です。記事に出てくる個別の銘柄名は売買の記録として書いたもので、売買を勧めるものではありません。
- 元本は Arm1・Arm2 各 $1,500(合計 $3,000)。失っても生活に影響しない範囲に意図的に抑えています。
- 記事内のバックテストの数値は、過去データの上での机上検証です。将来のリターンを保証するものではありません。バックテストの学習期間には強気相場が多く含まれます。
- 成績は 2026 年 9 月 23 日の終値までの、12 ヶ月実験の途中経過です。優劣の結論ではありません。
- 売買とシステム運用の最終的な判断と結果の責任は、すべて運用している私自身(ちらりんの飼い主)にあります。読まれる方ご自身の投資判断は、ご自身の責任で行ってください。
コメント