Ikhtisar
Penyelarasan beberapa urutan (MSA) menyelaraskan tiga atau lebih urutan biologis untuk mengidentifikasi kawasan konservasi yang dimiliki bersama di seluruh keluarga. Sementara penyelarasan berpasangan mengungkapkan kesamaan antara dua rangkaian, MSA menangkap kedalaman evolusi kelompok homolog, menyoroti residu yang telah dipertahankan selama jutaan tahun. Posisi-posisi yang dilestarikan ini seringkali penting untuk struktur, katalisis, atau regulasi. MSA adalah prasyarat untuk konstruksi pohon filogenetik, identifikasi domain protein, dan pembuatan logo sekuens yang memvisualisasikan pola konservasi.
Konsep Utama
Penyelarasan progresif, yang diterapkan di Clustal Omega dan MUSCLE, membangun MSA dengan terlebih dahulu membuat pohon panduan dari jarak berpasangan dan kemudian menyelaraskan urutan yang paling dekat hubungannya secara berulang. Metode berulang menyempurnakan penyelarasan awal dengan menyelaraskan kembali subkumpulan untuk meningkatkan skor objektif secara keseluruhan. Alat berbasis konsistensi seperti T-Coffee menggabungkan informasi dari penyelarasan berpasangan terhadap urutan ketiga untuk meningkatkan akurasi. Untuk kumpulan data yang sangat besar, MAFFT menggunakan transformasi Fourier cepat untuk mempercepat penyelarasan. Metrik penilaian kualitas seperti skor jumlah pasangan dan skor kolom mengevaluasi keandalan penyelarasan, dan alat pemangkasan menghilangkan wilayah yang tidak selaras sebelum analisis hilir.
Aplikasi
MSA sangat diperlukan untuk genomik komparatif genetika bakteri, yang mengidentifikasi gen yang dilestarikan di seluruh strain patogen. Ini meningkatkan sensitivitas pencarian homologi dalam proyek pengurutan DNA dan mengungkapkan residu penting secara fungsional dalam prediksi struktur protein. Dalam biologi evolusi, MSA memberikan masukan berbagai rangkaian yang diperlukan untuk kemungkinan maksimum dan inferensi filogenetik Bayesian, yang memungkinkan rekonstruksi rangkaian leluhur dan penanggalan peristiwa spesiasi.
Protokol Praktis
Untuk protein MSA dengan MAFFT, siapkan file FASTA dari urutan homolog (misalnya, dari hasil BLAST atau OrthoFinder). Jalankan MAFFT dengan strategi L-INS-i, yang paling akurat untuk <200 urutan: mafft --localpair --maxiterate 1000 input.fasta > aligned.fasta. Untuk kumpulan data yang lebih besar (urutan 200–1000), gunakan strategi FFT-NS-2: mafft --retree 2 --maxiterate 2 input.fasta > aligned.fasta. Untuk kumpulan data yang sangat besar (>1000 urutan), gunakan algoritma PartTree: mafft --parttree input.fasta > aligned.fasta. Untuk penyelarasan nukleotida, gunakan mafft --nuc --adjustdirection input.fasta > aligned.fasta untuk menangani untaian komplemen terbalik. Alternatifnya, jalankan MUSCLE v5: muscle -align input.fasta -output aligned.fasta. Nilai kualitas penyelarasan dengan inspeksi visual menggunakan Jalview: muat file FASTA yang telah disejajarkan, warnai dengan skema ClustalX (menyoroti posisi yang dilestarikan), dan memeriksa histogram konservasi. Pangkas bagian yang tidak selaras dengan trimAl: trimal -in aligned.fasta -out trimmed.fasta -automated1 yang secara otomatis memilih ambang pemangkasan optimal berdasarkan karakteristik penyelarasan. Untuk pemangkasan yang lebih ketat, gunakan -gt 0.1 (hapus kolom dengan celah >10% urutan) atau -resoverlap 0.75 -seqoverlap 80 untuk metode otomatis2 heuristik. Hitung statistik ringkasan penyelarasan dengan esl-alistat dari rangkaian HMMER: esl-alistat aligned.fasta. Buat logo urutan dengan WebLogo atau paket R ggseqlogo untuk memvisualisasikan konservasi asam amino spesifik posisi. Ubah perataan ke format PHYLIP untuk inferensi filogenetik: sed -e 's/>//' aligned.fasta | paste - - | awk '{print $1, $2}' > aligned.phy. Jalankan IQ-TREE untuk inferensi pohon kemungkinan maksimum: iqtree -s aligned.phy -m MFP -bb 1000 -nt AUTO.