Stanford大学Brian Hie研究室とArc Instituteが実証したのは、AIによるウイルスの「設計」そのものではなく、その設計を実際に機能するところまで検証し切ったことだ。ゲノム言語モデルEvoに合成ゲノムを生成させ、そこから285件の候補を選んで大腸菌に導入したところ、16件が実際に他の大腸菌株へ感染・増殖する機能的なバクテリオファージとして働いた——成功率は約5.6%と低いが、生成AIが「設計→合成→機能実証」という生体分子開発のループを、人間の介入なしに一気通貫で閉じた実例である点が本質だ。計算生物学・合成生物学の研究者にとっては、ゲノム言語モデルが配列の予測・解析ツールから、実際に機能する新規分子を生み出す設計ツールへと役割を広げたことを意味し、AIモデルが自律的に科学研究上のブレークスルーを積み重ねてきた流れに、生体分子の生成的設計という新しい軸が加わった。研究チームは学習データの段階でヒトウイルスの配列を意図的に除外し、対象もヒトに非病原性の大腸菌株に限定したと説明しているが、設計・合成・機能検証というループ自体は対象生物種を選ぶ技術的制約を持たない——学習データの選別だけで安全性を担保し続けられるのか、生体分子を生成できるAIに固有のガバナンスが必要になるのかという問いが、能力の実証と同時に浮上する。
何が起きたか
Stanford大学Brian Hie研究室とArc Institute(NVIDIA・UC Berkeleyも協力)の研究チームが、ゲノム言語モデルEvoを使って設計したバクテリオファージ(細菌に感染するウイルス)のゲノムを、非病原性の大腸菌株に導入する実験を行った。研究成果は2026年8月6日付でScience誌に「Generative design of bacteriophages with genome language models」として正式掲載された。研究自体は2025年9月12日にbioRxivプレプリントとして先行公開されており、今回はその査読を経た正式論文化が改めての報道のきっかけとなっている。
仕組み・詳細
Evoは200万件超のファージゲノムで学習された上に、99%配列同一性でクラスタリングした14,466件のMicroviridae科配列でファインチューニングされたゲノム言語モデルである。研究チームは自然種ΦX174(Microviridae科)の設計を土台に、Evoに数百規模の合成ゲノムを生成させ、そのうち285件を候補として選び出してDNA分子として合成し、非病原性の実験室株「E. coli C」に導入した。
数字で見る
- 学習データ: ファージゲノム200万件超 + Microviridae科14,466配列(99%同一性でクラスタリング)
- テストした候補ゲノム数: 285件
- 増殖阻害(感染成立の指標)を示し配列検証された機能的ファージ: 16件(成功率 約5.6%)
- 機能が確認された16件はいずれもE. coli CおよびE. coli Wへの感染に限定(トロピズムが限定的)
- 既知の自然配列に見られない変異を含むゲノム: 13件
- そのうち1系統は既知ファージNC51との核酸同一性93.0%——分類学上の一部基準では新種相当と評価されうる水準
背景
今回の研究は、AIによる生体分子設計が「配列の予測・解析」から「実際に機能する分子の生成」へと踏み出した実証例として位置づけられる。研究チームは、学習データの段階でヒトウイルスの配列を意図的に除外しており、これによって偶発的・意図的を問わずヒト病原体の設計への転用を防いでいると説明している。今回の実験対象も終始、ヒトに非病原性の大腸菌株に限定されている。
なぜ重要か
計算生物学・合成生物学の研究者にとって、この実証が示すのは、ゲノム言語モデルが配列解析や変異効果予測にとどまらず、実際に機能する新規の生体分子を「設計→合成→機能検証」まで一気通貫で生み出せるようになったという能力の転換点だ。AIモデルが自律的に科学研究上のブレークスルーを積み重ねてきた流れの中に、生体分子の生成的設計という新しい軸が加わったことになる。
一方で、この技術の安全性は今のところ「学習データからヒト病原体配列を除外する」というデータ選別に依存している。設計・合成・機能検証というループそのものは対象生物種を選ぶ技術的制約を持たないため、同種の技術がヒト以外の宿主や、より学習データが豊富な生物種を対象に拡張されたとき、データ選別だけで安全性を担保し続けられるのか——生体分子を生成できるAIに固有のガバナンスが必要になるのか、という問いが、能力の実証と同時に浮上している。