ヒトのDNAで起こり得る「一文字の置き換え」を、約90億通りまとめてAIに予測させた。こう聞くと、遺伝病の答えが全部載った分厚い解答集を想像したくなります。いや、ちょっと待ってください。今回できたのは解答集というより、調べる場所に印をつけた巨大な地図です。
Google DeepMindが公開した「AlphaGenome Atlas」が速めるのは、怪しそうな変異を絞り込み、次の実験へ進む順番を決めるところです。診断や実験を丸ごと飛ばす機械ではありません。ここを分けて読むと、90億という数字の大きさに目を回さず、本当の便利さが見えてきます。
Google DeepMindは、ヒトゲノムで起こり得る約90億通り全ての一塩基変異の影響を事前予測したデータベース「AlphaGenome Atlas」を公開した。影響度を数値化するスコアも導入し、未解明な非コード領域の変異解析を加速させる。学術研究向けにWebから無償提供する。
今回の登場人物
- AlphaGenome Atlas: ヒトゲノムの約90億通りの一塩基置換について、分子への影響予測を先に計算して検索できるようにしたデータベースです。病名を当てる名簿ではなく、研究者が候補を探す地図です。
- AlphaGenome: DNA配列を読み、遺伝子の働き方やRNAの加工などが変異でどう変わりそうかを予測するAIです。Atlasの予測を作った本体に当たります。
- AVIスコア: 「AlphaGenome Variant Impact」の略で、変異の影響が大きそうかを一つの数値にまとめた指標です。合否判定ではなく、詳しく調べる順番を決める整理券だと思ってください。
- コード領域と非コード領域: コード領域はタンパク質の設計図を直接書く部分で、全体の約2%です。残る約98%には遺伝子をいつ、どこで、どれくらい働かせるかを調節する部分などがあります。
- AlphaMissense: タンパク質を作る領域のうち、一つのアミノ酸を別のものへ変える「ミスセンス変異」を評価するAIです。AVIスコアは、このモデルの予測もAlphaGenomeの予測と組み合わせます。
何が起きたか
ITmedia NEWSは9月9日、Google DeepMindが前日の8日にAlphaGenome Atlasを公開したと報じました。対象は、ヒトゲノムで考えられる約90億通りの一塩基変異です。データ量は約1ペタバイトで、同社によればAlphaFold Databaseの30倍を超えます。学術研究者はWebポータルから無料で利用でき、APIでも検索できます。
「90億」の作り方は、魔法というより掛け算です。ヒトゲノムには約30億の塩基位置があり、それぞれの位置では、元の文字とは別の3種類へ置き換えられます。約30億掛ける3で約90億。つまりAtlasが網羅したのは、一文字だけを別の文字へ変える「一塩基置換」です。
ここは大事なので、赤鉛筆で丸をつけたいところです。DNAの変化には、文字の挿入や欠失、長い範囲の重複、染色体の大きな組み換えもあります。Atlasは「人間に起こり得るあらゆる遺伝子変異を解いた」のではありません。90億は途方もない数ですが、範囲の決まった途方もなさなんです。
ここが本題
では、Atlasで何が速くなるのか。答えは、研究の前半にある「候補探し」です。
ある病気や体質と関係しそうなDNA変異を調べると、候補が何千、何万、場合によっては何百万と並びます。その全部を細胞や動物で一つずつ試すのは、時間も費用も足りません。研究者はまず、どの変異が分子の働きを変えそうかを予測し、実験する候補を絞ります。巨大な干し草の山から針を探す前に、「この辺、ちょっと光っていますよ」と印をつけるわけです。
従来のAlphaGenomeでも、指定した変異の前後を比べて、遺伝子発現やRNAスプライシングなどへの影響を予測できました。ただ、研究者が調べたい変異を選び、コードを書き、計算を走らせる必要がありました。Atlasは、その計算を約90億通りについて先に済ませています。研究者は同じ重い計算を何度も繰り返さず、検索結果から出発できます。
料理にたとえるなら、AIが晩ご飯を完成させたのではなく、巨大な食材庫の棚卸しを済ませ、「先に傷みを確認したほうがいい箱」を並べてくれた感じです。包丁も味見も、まだこちらの担当です。
AVIは判決ではない
候補を並べ替える役がAVIスコアです。AlphaGenomeは、遺伝子がどれほど読まれるか、RNAがどこで切りつながるか、DNAのどの部分が使われやすくなるかなど、数多くの分子レベルの項目を予測します。そこへ、タンパク質への影響を予測するAlphaMissenseの情報も合わせ、変異ごとの影響を一つの数値に圧縮します。
一つの数字で並べられると、候補の山を上から見られます。しかもAtlasには、RNAスプライシングや遺伝子発現など、何がスコアを押し上げたのかを示す内訳もあります。「高そう」で終わらず、「この変異はRNAのつなぎ方を乱すのでは」という実験可能な仮説へ進みやすい。いや、ここがミソなんですよ。便利なのは数字そのものより、次に何を確かめるかが見えることです。
ただし、AVIは裁判官ではありません。高得点だから病気の原因と確定するわけでも、低得点だから無害と確定するわけでもない。複雑な分子の動きを一つへまとめれば、どうしても情報は削られます。独立した研究者もIEEE Spectrumの取材で、単一スコアは役立つ一方、誤解されやすいと注意しています。
実験が残る理由
Google DeepMindが紹介した希少疾患研究では、AVIスコアを使って候補を絞り、てんかん性脳症との関係が知られるDNM1という遺伝子の変異に注目しました。AlphaGenomeは、その変異が誤ったRNAスプライシング位置を作ると予測しました。そして研究チームは、実験によってその分子作用を確かめています。
この順番を逆さにしないことが大切です。「AIが見つけたから正しい」ではなく、「AIが候補と仕組みを示し、実験が確かめた」です。予測が優秀でも、現実の細胞で同じことが起きるかは別に確認しなければなりません。一件の成功例が、残る約90億件すべての正しさを保証するわけでもありません。
AlphaGenomeには限界もあります。DNA配列を最大100万文字まで見られますが、非常に遠く離れた調節部分の影響を正確につかむことは、なお難しいと開発元が説明しています。細胞や組織ごとの違いも、さらに改善が必要です。人の病気や体質は、DNAの一文字だけで決まらず、発達の過程、ほかの遺伝子、生活環境などが重なる場合もあります。
つまりAtlasが予測するのは、「このDNA変化が分子の働きをどう動かしそうか」です。「この人が何歳で発症するか」「この症状の原因はこれで決まりか」までを答えるものではありません。天気図が雨雲を示しても、あなたの靴下が何時にぬれるかまでは決めないのと似ています。傘を持つ判断には役立つ。でも予言書ではない、という距離感です。
診断が残る理由
診断では、患者の症状や家族歴、変異が集団でどれくらい見つかるか、家族内で病気と一緒に受け継がれているか、細胞実験で機能変化が確認できるかなど、複数の証拠を組み合わせます。計算予測は、その一部を支える材料です。米国の医学遺伝学の指針でも、コンピューター予測は単独の最終判定ではなく、病原性を考える際の補助的証拠として扱われます。
開発元は、個人ゲノム予測についてはまだ性能評価をしておらず、直接の臨床利用についても検証・承認されていないと明記しています。利用条件には、臨床判断や医療上の助言へ使ってはならないともあります。この一文、地味ですが記事のブレーキとしてかなり重要です。速い車ほど、ブレーキの説明書を先に読んだほうがいいんですね。
速くなる研究
先行利用では、英エクセター大学の研究者がUK Biobankの5万4000人を超える全ゲノムデータにAtlasを使い、非コード領域の関連を22%多く検出したとGoogle DeepMindは発表しています。影響が大きいと予測された上位1%へ絞り、BMIに関連する19のゲノム領域を見つけたともしています。
ただし、この22%を「診断精度が22%上がった」と読み替えてはいけません。特定の集団データと解析方法で、統計的な雑音に埋もれていた関連をより多く拾えた、という研究上の数字です。一般の病院で22%多く病名がつく、という話ではありません。
Atlasの価値は、答えを代行することより、問いを立てる速度を上げるところにあります。非コード領域のどこが効きそうか、どの細胞で確かめるべきか、どの候補を先に実験するか。研究者が判断に使う材料を、コードを書かなくても引ける。計算設備を持たない研究チームにも入口が広がります。
日本から見る意味
日本の研究者も、非商用研究向けのWebポータルやAPIを利用できます。希少疾患の原因候補や、病気に関係する非コード領域を調べる研究では、最初の候補選びが軽くなる可能性があります。新薬の標的探しでも、どの変異と分子経路を先に深掘りするかという下調べに使えます。
一方、日本の患者に新しい診断サービスが今日から届く、というニュースではありません。Atlasの予測を診療へ持ち込むには、性能の独立検証、病気ごとの基準、ほかの臨床証拠との組み合わせが必要です。
私たちがこのニュースから持ち帰るべきなのは、「AIが90億個の正解を出した」ではありません。「90億個の候補に、調べる順番と理由をつけられるようになった」です。似ているようで、科学ではこの差が大きい。地図が良くなれば探検は速くなる。でも、地図の上に宝箱の中身までは書いていない。最後は現地へ行って、ふたを開ける必要があります。
まとめ
AlphaGenome Atlasは、ヒト参照ゲノムで可能な約90億通りの一塩基置換について、分子への影響を事前計算した予測地図です。AVIスコアで候補を順位付けし、どの分子過程が変わりそうかまでたどれるため、研究者は実験する候補を速く絞れます。
けれども、対象はすべての種類の遺伝子変異ではなく、出力も病気の確定判定ではありません。複雑な体質や疾患には、ほかの遺伝子、発達、環境、患者の症状が関わります。だから研究の正しい流れは、Atlasで候補を探し、実験で確かめ、臨床情報と合わせて判断することです。
90億という数字に圧倒されたら、こう言い直せば大丈夫です。診断のゴールが自動化されたのではなく、スタート地点の渋滞がほどけた。今回の本題は、そこです。
Sources
- ITmedia NEWS「Google DeepMind、90億通りの全塩基変異の影響を予測した『AlphaGenome Atlas』」
- Google DeepMind「AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome」
- Google DeepMind「AlphaGenome: AI for better understanding the genome」
- Nature「Advancing regulatory variant effect prediction with AlphaGenome」
- Google DeepMind AlphaGenome API
- IEEE Spectrum「Google DeepMind Maps 9 Billion Possible DNA Variants」
- ACMG/AMP「Standards and Guidelines for the Interpretation of Sequence Variants」