リレーエッセイ

データを取りにいく

作成者: Admin|Sep 24, 2026, 2:38:29 AM

私が研究者として初めて「生のデータ」に触れたのは、2001年の春だった。数学科を出て、大学院では統計的モデル評価基準という理論的なテーマで学位をとった私は、その年の4月、東京大学医科学研究所のヒトゲノム解析センターに博士研究員として着任した。そこで最初に取り組んだのが、ヒトの遺伝子の働きを数値化したデータの解析である。ヒトゲノムにはおよそ2万個の遺伝子があり、その一つひとつがどれだけ活発に働いているかを測ると、1人分のデータは約2万次元のベクトルになる。当時としては桁外れに高次元の情報だった。しかも検出感度の限界などから、あちこちに欠損値がある。教科書に載っているきれいなサンプルデータとは、まるで別物だった。理論の世界から来た私にとって、これは新鮮な衝撃だった。現実のデータサイエンスは、整ったデータが天から降ってくるのを待つのではなく、データを「取りにいく」ところから始まる——このことを、私はその後の20数年をかけて、何度も思い知ることになる。

以来、私の研究の柱はゲノムであり続けた。2000年代は、遺伝子どうしの働きの関係、いわゆる遺伝子ネットワークの推定に夢中になった。2008年ごろからは次世代シークエンサーが登場し、個人のゲノムをまるごと読めるようになった。1人分の全ゲノムを読むコストは、当初の数千万円から急速に下がり、2014年にはいわゆる「1000ドルゲノム」が達成された。私たちは2013年から、がん患者さんのゲノムを読んで治療に役立つ情報を主治医に返す「臨床シークエンス」を医科研で始め、月に2度、解析結果を医学的に検討するカンファレンスを続けてきた。この流れはやがて、厚生労働省が2019年に策定した「全ゲノム解析等実行計画」という国家プロジェクトにつながっていく。私はそのがん領域の解析班の研究代表者として、これまでに約2万症例という国内最大規模のがん全ゲノムを解析する基盤の構築に携わってきた。だから、私を知る人の多くは、私を「ゲノムの研究者」だと思っている。

ところが私は、ゲノムとは縁のなさそうな研究も、ずいぶん手がけてきた。医師の不足や働き方の調査、感染症のシミュレーション——こうした仕事に取り組む私を、不思議に思う人もいたと思う。だが、これらの一見バラバラな研究は、私の中では1本の線でつながっている。その線とは、「正しいデータをどう取得するか」という問いである。

1つ、例をあげたい。2016年、私は厚生労働省の検討会のために、医師の勤務実態を調べる大規模調査の班長を務めた。過去最大となる10万人の医師に調査票を配り、1週間にわたって働いた時間を記録してもらう調査である。ここで私が最も頭を悩ませたのは、統計の手法ではなかった。「日々きわめて多忙な医師に、どうすれば答えてもらえるか」ということだった。どれほど精緻な統計解析を計画していても、回答してもらえなければデータは得られない。もしこれが研究者個人(私)の興味による調査だと受け取られれば、多くの医師は忙しさの中で回答してくれないだろう。そこで私は、病院にとって重い意味を持つ厚生労働省の医政局長に協力依頼状を書いてもらい、調査票に同封して送った。「良質なデータをどう取りにいくか」、その設計こそが、統計家やデータサイエンティストの腕の見せどころなのだ。この調査で得られた「週60時間を超えて働く医師が約4割」という数字は、調査から10年が経った今も、医師の働き方改革の進み具合を測る基準として使われ続けている。現実を正しく捉えたデータは、時を超えて生き続ける。

感染症の研究では、必要なデータを自分たちの手で取りにいく、忘れがたい経験をした。コロナ禍のさなか、私たちは地域の感染の広がりを下水から捉える「下水疫学調査」に取り組んだ。人々の排泄物に含まれるウイルスを下水から測れば、症状のない感染者まで含めて、地域全体の感染状況を安価に把握できる。ところが、日本では感染者が少なく、下水中のウイルス濃度は、欧米で使われている方法の検出限界を下回っていた。私たちは、従来より100倍以上高感度の検査法を開発する必要に迫られた。だが、その性能を確かめるためには、「濃度は低いが、確かにウイルスが入っている本物の下水」がどうしても必要だった。私は当初、「水で薄めればよいのでは」と口にした。すると、共同研究者の専門家に「それは本物の下水ではない」と一蹴された。その通りである。人工的に薄めた水では、実際の下水に含まれる夾雑物の影響が再現できず、検証にならないのだ。そこで私たちは、軽症の感染者が待機するホテルに目をつけた。そこには確実に陽性者がいる。交渉の末に地下の下水を採らせてもらうと、その建物には、下水道が整備されていない土地ゆえの立派な浄化設備があり、複数の槽を経るごとにウイルス濃度が段階的に下がっていた。まさに私たちが欲しかった「本物の濃度勾配」が、そこにあった。

こうして磨いた検査法を、私たちは東京オリンピック・パラリンピックの選手村に持ち込んだ。当初は各棟の下水を自動で採る計画だったが、常時マンホールを開けておくわけにはいかず、下水採取のために開けられるのはわずか3か所だと言われた。私たちは選手村の下水道の地図とにらめっこし、複数の経路が合流する「奇跡の3つのマンホール」を見つけ出す。その3点で採れば、選手村を7つの区画に分けて、区画ごとの感染状況を追えることが分かったのだ。大会期間の52日間、毎朝下水を採ってはその日のうちにウイルス濃度を測り、結果を運営に返した。すると、選手への抗原検査では陽性者がいないはずの区画からも、下水にはウイルスが出てくることがあった。個人検査よりも早く、集団の中の感染の火種を捉えていたのである。

私は大学院生のころ、自分が将来、マンホールの位置を考えながらデータを集めることになるとは夢にも思っていなかった。だが、振り返ってみれば、私がしていたことは大学院時代からそれほど変わっていないのかもしれない。知りたい現象がある。その現象を説明するために、どんな情報が必要なのかを考える。必要な情報をどう測ればよいかを考える。そして、得られたデータから、目に見えない構造を読み解く。対象が遺伝子発現データから下水に変わっただけで、問いの立て方は同じだった。

こうした経験を通して、私の中で一つの考えが、しだいに揺るがぬものになっていった。データは、ただ集めれば真実を語ってくれるわけではない。何を測ったのか。いつ、どこで測ったのか。どのように測ったのか。そして、そのデータは本当に自分たちが知りたい現象を映しているのか。そこを間違えれば、どれほど高度な解析を施しても、正しい答えにはたどり着けない。これは感染症の政策判断でも、ゲノムに基づく医療でも、まったく同じである。ゲノム医療で患者さんに有効な治療を届けようとするときも、その方の「今」の病状を正しく反映した検体から得たデータが必要になる。何か月、あるいは何年も前に採取したがん細胞のデータは、もはや目の前の患者さんの状態を正確には映していないかもしれない。感染症研究で身につけた「どの時点で、どこから、何を取るのか」という感覚は、そのままゲノム医療の検体をめぐる議論につながっている。

この2つの世界が1つに溶け合った瞬間がある。あるプロサッカーチームでクラスター感染が起きたとき、選手たちの行動を丹念に追っても、感染がロッカールームで起きたのか、遠征バスの中で起きたのか、どうしても決められなかった。そこで私は、感染者から採れたウイルスのゲノムを読んだ。誰が誰かを伏せたままゲノム配列だけを解析すると、ロッカールームで濃厚接触のあった者どうしのウイルスは配列がぴたりと一致し、一方でバスに同乗していた者のウイルスには食い違いがあった。ウイルスは増えるうちに新たな変異を得ることはあっても、いったん得た変異が消えることは、確率的にほとんど起こらない。この理屈から、バスの中での感染は否定され、ロッカールームでの感染対策が強化された。「ゲノムの研究者」である私と、「感染症のデータサイエンティスト」である私が、1本のウイルスゲノム配列の上で完全に重なった出来事だった。

データサイエンスの面白さの一つは、ここにあると思う。ある分野で身につけたデータの見方や考え方が、思いもよらない別の問題を解く力になる。私はゲノムを研究してきた。医師の働き方も調べた。感染症のシミュレーションも行い、下水も採った。一見すると、ずいぶん節操のない研究人生に見えるかもしれない。しかし私自身は、分野を転々としてきたという感覚はあまりない。

目の前に解かなければならない問題があり、その問題を解くために必要なデータを考え、データがなければ取りにいく。それを繰り返してきただけである。その過程で、自分がもともと専門としていた分野の境界が、少しずつ広がっていった。私は大学院で、データを解析する統計学の一面を学んだ。しかし、その後の研究人生を通して、私は統計学やデータサイエンスにはもう一つの側面があると考えるようになった。それは、まだデータになっていない現象に目を向け、その現象をどうすればデータとして捉えられるのかを考えることである。医師にどうすれば調査に答えてもらえるかを考えることもあれば、感染者のいるホテルに頼んで下水を採らせてもらうこともある。選手村の下水道の地図を広げて、マンホールを探すこともある。そうして苦労して手に入れたデータの中に、それまで誰にも見えていなかった現象の真の姿が姿を現す瞬間がある。私は、その瞬間が好きなのだと思う。

与えられたデータを解析するだけでは、たどり着けない場所がある。現実の世界に出て、自分たちが本当に知りたいことは何なのかを考え、そのためのデータを自ら取りにいく。そして、得られたデータを丁寧に解析し、そこから得た情報を社会に返していく。それが、統計とデータサイエンスに携わる私たちの仕事なのだと思う。データサイエンスのいちばんの面白さは、洗練された解析の中だけにあるのではない。その少し手前にある。まだデータのないところへ足を運び、泥臭くデータを取りにいく。その最初の一歩にこそ、データサイエンスの本当の面白さが宿っているのではないかと、私は思っている。