AI科学発見編 / 第108話

第108話:イトは、百枚の答えを一枚も採用しなかった|AIが作った仮説はいつ発見になる?

ピコルート第108話。AIが一晩で百個の仮説を作るが、実験枠は六つだけ。イトが面白い答えより、反証条件・対照・未使用データ・再現を選びます。

AI科学発見仮説生成反証可能性再現性検証ボトルネック11分更新

百枚目の紙が、printerから床へ落ちた。

一枚目には「温度」。

三十七枚目には「青い光」。

九十九枚目には「月の満ち欠け」。

どの紙にも、金色のstampが付いている。

DISCOVERY CANDIDATE

イトは、rank 1の紙を両手で持ち上げた。

hypothesis
  prior blue-light exposure increases night emission

AI rank             1 / 100
historical fit          94%
test slots available       6
phenomenon ends        noon

「一位を試して、光ったら発見だ」

窓の外で、ピコ植物の青い葉が朝日に透けていた。

実験できるのは、あと六回。

仮説を作る速さと、現実が答える速さは違う

AIは、literature、過去data、研究者のgoalを材料に、hypothesisやexperiment proposalを生成・比較できる。

実際のAI co-scientist研究でも、生成、批評、ranking、refinementを組み合わせ、専門家を含むlaboratory validationへ進める試みがある。

ただし、AI内部のrankingは、自然界から届いた答えではない。

system自身の評価や既存dataへのfitが高くても、独立したground truthとは限らない。

候補を増やすcostが下がるほど、次に詰まるのは検証だ。

cheap and fast
  generate / rewrite / rank candidates

slow and scarce
  samples / instruments / expert time
  controls / replication / independent review

printerは、さらに九百枚を作れると表示した。

イトは紙の補充trayを閉じた。

よくある誤解:AIが新しい仮説を作り、一位にrankしたら発見である

仮説は、まだ現実へ聞いていない質問だ。

novelに見えても、既知研究の言い換えかもしれない。

引用が付いていても、sourceが主張を支えているとは限らない。

過去dataによくfitしても、そのdataを見ながら作った説明なら、未知dataでも当たるかは別だ。

どんな結果が出ても説明を足して正しいと言えるなら、間違いを検出できない。

candidate needs
  distinct claim
  prior evidence check
  measurable prediction
  result that would count against it
  feasible test

「月の満ち欠けなら、いちばん記事になりそう」

イトは九十九枚目を見た。

ユイが聞く。

「昼のlabで、六回の枠を使って、何が出たらその説明を捨てられる?」

紙には、反証条件がなかった。

現象が終わるまで三時間。三つの選択

百個のcandidate。

六つのchamber slot。

正午を過ぎると、葉の青い現象は消える。

A:AI rank 1を、過去dataでもう一度評価する

追加の試料を使わず、すぐ高いscoreを出せる。

しかし、hypothesisを作りrankした同じ二十四回の記録を再利用するため、新しい現実へのtestにならない。

B:上位六仮説を、一回ずつ試す

breadthは広い。

一つずつ異なる装置と判定を使えば、noise、偶然、instrument artifactを見分けるrepeatもcontrolも足りない。

C:百枚を絞り、一仮説へ六slotを使い、失敗条件を先に固定する

duplicate、既知研究、測定不能、反証不能を分ける。

残った一仮説について、control、未使用sample、二つのdetector、事前の判定条件へ枠を使う。

今回は他の仮説を試せない。

イトはrank 1と月の紙を、どちらもCANDIDATE箱へ戻した。

「一番おもしろい紙じゃなく、一番はっきり間違えられる問いを選ぶ」

イトが百枚の出口を閉じ、一枚のtest cardを登録する

イトはprinterのwide output gateを閉じた。

床の百枚を発見boxへ入れず、重複を重ねるrackへ戻す。

その横で、blankだった一枚のtest cardへ実験前の条件を固定する。

イトが百枚を吐き出すAI printer gateを閉じ、一枚のregistered test cardと六つのexperiment slotだけを開く

generated candidates       100
distinct clusters           24
already known / near-known  11
not measurable here          4
no stated falsifier           3
feasible candidates           6
confirmatory test selected    1

既知に近い仮説も、価値が0という意味ではない。

再現や別条件での確認に使える。

今回は「新発見候補」と混ぜず、別labelへ置く。

結果を見る前に、何を結果と呼ぶか決める

選んだ問いは、一位だった青色光仮説だ。

claim
  blue-light pre-exposure increases emitted light
  after the illumination source is off

primary readout
  intensity at fixed time after lights-off

sample
  leaves not used in generation or ranking

controls
  no blue pre-exposure
  blank optical reference

cross-check
  detector A and detector B

counts against claim
  increase does not appear across both detectors
  or signal follows detector angle / blank reference

sampleのcodeだけをP-R01に見せ、青色光あり / なしを測定者から隠す。

damaged leafの除外ruleも、chamberを開く前に書く。

事前登録は、良い仮説や正しいmethodを自動で作る仕組みではない。

結果を見た後のexplorationと、最初から予定したconfirmatory testを区別しやすくする記録だ。

この物語の六slot testも、一般の科学分野へそのまま使えるprotocolではない。

対象ごとにsample size、measurement、analysis、safety、ethicsを専門家が設計する。

一つ目のdetectorでは、発見に見えた

六つのchamber blockを動かす。

各blockには、code化した複数のleaf、control、blank referenceが入っている。

detector Aの結果が出た。

detector A
  pre-exposed group     +12.4%
  threshold crossed        yes

イトの手が、金色のDISCOVERY stampへ伸びた。

でも、test cardにはboth detectorsと書いてある。

detector Bを開く。

detector B
  pre-exposed group      +0.8%
  threshold crossed         no

二つは一致しない。

detector Aの角度を変える。

葉ではなく、blank referenceの光まで一緒に動いた。

angle swap
  leaf signal follows detector angle
  blank reference also rises

registered conclusion
  hypothesis not supported in this fixture
  instrument artifact suspected

「AIの仮説が外れた?」

「少なくとも、登録した条件では支持されなかった」

ユイはFALSE stampも押さない。

このtestだけで、あらゆる条件の青色光効果が存在しないとは言えない。

原因候補はinstrument artifactだが、それも別の確認が要る。

再現できない結果を、消さない

二日後、別の小さなlabから結果が届いた。

同じtest card、別sample、別instrument。

independent run
  registered effect observed     no
  protocol deviation             none reported
  raw data received              yes

current label
  NOT REPLICATED
  NOT A DISCOVERY

reproducibilityとreplicabilityは、文脈で意味を分けて使う。

計算手順なら、同じdataとcodeから同じ結果を得られるか。

新しいdataを取る研究なら、同じ問いを別studyでも支持できるか。

今回の別lab runは、後者を狙う小さなfixtureだ。

一回の不一致だけで最終結論にはしないが、都合の悪い結果を隠して「発見」を守ることもしない。

paper trail
  hypothesis candidate
  registered test plan
  raw observations
  deviations
  negative / inconclusive results
  replication attempts

negative resultも、次のAIが同じ道を新発見として出し直すのを防ぐknowledgeになる。

百個を七個へ減らすこと。

一個へ実験資源を集めること。

支持されなかったと公開すること。

どれも、生成より遅い。

発見boxは空のまま、検証記録だけが残った

昼を過ぎ、ピコ植物の青い光が消えた。

金色のDISCOVERY boxには、一枚も入っていない。

その隣に、透明なboxがある。

generated            100
tested                  1
supported               0
not replicated          1
discovery               0
next instrument check   1

イトは、空のboxを隠さなかった。

一番上へ、detector angleを変えた記録を置く。

「答えは見つからなかった」

「でも、発見していないことは確かめられた」

printerは静かになった。

代わりに、見学会の予約siteからnotificationが来る。

別labの協力者が、再現会へ申し込もうとしている。

pageには、青いbuttonが三つ並んでいた。

どれも同じ言葉だ。

こちら

AI研究助手が、一番上のbuttonへ手を伸ばす。

行き先も、送るdataも確認していない。

イトは、空の発見boxの前で、今度はsiteの公開leverを見た。

次回、ピコルート第109話。

イトは、予約サイトを止めた|「こちら」が招いた迷子

この物語を、解説で深める

第108話で生まれた疑問を、解説記事で少し深く見ていきます。物語で感じた不思議さを残したまま、言葉と仕組みを順番に整理しましょう。

AIによる科学発見とは?AIは新しい法則を見つけられる?を読む

この出来事の「いま」と「次」を分けて見る

AIと科学発見を、観測と体験へつなぐ