バイオインフォマティクスとは?生物のデータをコンピューターで読む

DNAを読み取ると、大量の文字の並びとして扱える情報が得られます。でも、その文字列を眺めるだけで、生物の働きが全部わかるわけではありません。バイオインフォマティクスは、コンピューターと情報科学を使って、生物のデータから意味を探す分野です。

生物学と情報科学が出会うところ

バイオインフォマティクスでは、DNAやRNAの配列、タンパク質、遺伝子の発現など、生物に関するデータを分析します。単にデータを保存するだけでなく、比較し、傾向を探し、仮説を作ることにも関わります。

「コンピューターへ入れれば答えが出る」という分野ではありません。どんな生物学的な問いを立てるか、どのデータを使うか、結果をどう確かめるかが、計算と一緒に必要です。

短いDNAの並びを比べてみる

DNAの配列は、A・T・G・Cという文字で表せます。説明用に、次の架空の短い並びを考えます。実際の遺伝子や診断用のデータではありません。

並びA:ATGCACT
並びB:ATGTACT

同じ位置を比べると、4文字目がCとTで違い、ほかの6文字は同じです。このように文字の一致や違いを調べることが、配列比較の入口になります。

ただし実際の配列では、文字が置き換わるだけでなく、途中に挿入されたり、抜けたりする場合も考える必要があります。単に同じ位置を一つずつ比べる方法だけでは、うまく対応づけられないことがあるのです。

どの位置どうしを比べるかが、分析の一部

文章を比べるときも、一方に一語が追加されると、その後の文字の位置がずれます。追加された箇所を考慮して並べると、ほかの部分はよく似ているとわかるかもしれません。

生物の配列でも、比較する位置を対応づけるアラインメントが重要になります。似ている場所をどう探すか、ずれをどう扱うかには、計算の方法や設定が関わります。「一致率」という数字だけでなく、どの範囲を、どう比べた結果かを見る必要があります。

BLASTは、似た配列を探す道具

NCBIのBLASTは、生物の配列どうしの局所的な類似を探し、データベースの配列と比較する道具です。結果には、似ている領域や、その一致の統計的な意味を考える情報が含まれます。

辞書から似た文を探すように、未知の配列を既知の情報と照らし合わせる入口になります。ただし、似ている配列が見つかったことから、その生物や機能を一つに断定できるとは限りません。比較の範囲、データベースにある情報、ほかの実験結果も関わります。

データの量より、問いとのつながりが大切

例えば「二つの条件で、どの遺伝子の発現が違うか」を調べたいなら、条件の記録や測定の質が重要です。違う日の測定を混ぜたり、片方だけ別の方法で測ったりすると、生物の違いと測定の違いを切り分けにくくなります。

大量のデータでも、比較する条件がわからなければ解釈は難しくなります。逆に、問いと測定条件がはっきりしたデータは、分析の目的を明確にします。生物の特徴を幅広く測るフェノミクスとも、この点でつながります。

計算は、次の実験の問いを作る

分析で「この配列や遺伝子が関係していそうだ」とわかったら、次にその働きを調べる問いを立てられます。計算の結果と、実験で確かめたことを行き来しながら理解を進めます。

バイオインフォマティクスを知ると、DNAの解析を「文字を読む技術」だけでなく、「読み取った情報を比較し、問いへ変える仕事」として見られます。生物の不思議と、アルゴリズムの工夫が出会う分野なのです。

コメントを残す

メールアドレスが公開されることはありません。 * が付いている欄は必須項目です