Ikhtisar
Model Markov tersembunyi (HMM) adalah model statistik yang merepresentasikan rangkaian peristiwa yang dapat diamati yang dihasilkan oleh rangkaian keadaan yang tidak teramati (tersembunyi). Dalam bioinformatika, HMM memodelkan urutan biologis di mana keadaan tersembunyi mungkin mewakili batas ekson/intron, elemen struktur sekunder protein, atau kolom yang dilestarikan dalam penyelarasan beberapa urutan. Kekuatan kerangka HMM terletak pada kemampuannya untuk menangkap pola konservasi, penyisipan, dan penghapusan posisi spesifik melalui arsitektur probabilistik terpadu yang dilatih dari contoh-contoh yang diketahui.
Konsep Utama
HMM ditentukan oleh tiga set parameter: probabilitas transisi antar keadaan tersembunyi, probabilitas emisi mengamati simbol dari setiap keadaan, dan probabilitas keadaan awal. Algoritme Viterbi menemukan urutan keadaan tersembunyi yang paling mungkin untuk pengamatan tertentu, misalnya, struktur gen yang paling mungkin untuk urutan DNA genom. Algoritme maju-mundur menghitung probabilitas posterior setiap keadaan di setiap posisi, yang dapat digunakan untuk menilai keyakinan prediksi. HMM Profil, dibuat dari beberapa penyelarasan urutan, memodelkan keluarga domain protein. Paket perangkat lunak HMMER menggunakan profil HMM untuk deteksi homologi jarak jauh yang sensitif, mengungguli BLAST untuk rangkaian yang berbeda.
Aplikasi
HMM digunakan untuk prediksi gen dalam genom prokariotik dan eukariotik, mengidentifikasi lokasi sambungan dan wilayah pengkodean. Profil HMM mengklasifikasikan protein menjadi famili dan superfamili, membantu prediksi struktur protein dan anotasi fungsional. Mereka memodelkan kekhususan substrat dalam klasifikasi dan tata nama enzim dan mendeteksi elemen pengatur dalam struktur dan topologi DNA. Dalam metagenomik, HMM memberikan peran fungsional pada fragmen yang tidak diketahui asalnya.
Protokol Praktis
Rangkaian perangkat lunak HMMER memungkinkan pembuatan dan pencarian profil HMM. Untuk mencari kueri protein terhadap database domain Pfam, gunakan hmmscan: hmmscan --cpu 8 --domtblout domains.txt Pfam-A.hmm query_proteins.fasta. File keluaran domtblout melaporkan hit per domain dengan nilai E, skor bit, dan koordinat penyelarasan. Nilai E domain mengukur signifikansi kecocokan domain; nilai <0,01 menunjukkan pukulan yang meyakinkan. Skor bit (dalam nats) tidak bergantung pada ukuran database, sehingga memungkinkan perbandingan silang. Untuk membuat profil khusus HMM dari perataan beberapa urutan: buat HMM dengan hmmbuild my_domain.hmm aligned_seqs.sto, dengan perataan masukan harus dalam format Stockholm. Kalibrasi HMM untuk perhitungan nilai-E: hmmcalibrate --cpu 8 my_domain.hmm. Cari database urutan dengan HMM Anda: hmmsearch -E 1e-5 --cpu 8 --tblout hits.txt my_domain.hmm target_sequences.fasta. Tabel --tblout mencantumkan pukulan dengan skor terbaik per urutan target. Untuk deteksi dan penyelarasan homologi berulang, gunakan jackhmmer: jackhmmer -N 5 --cpu 8 --tblout jackhmmer_output.txt query.fasta uniprot_sprot.fasta. Jackhmmer mencari database secara berulang, menggunakan hit setiap putaran untuk membangun HMM baru untuk putaran berikutnya, biasanya berkumpul setelah 5 iterasi. Menafsirkan nilai-E: di HMMER3, nilai-E memperhitungkan ukuran database target dan panjang HMM; nilai <0,01 dianggap signifikan untuk identifikasi domain. Untuk menganotasi seluruh konfigurasi metagenomik, gunakan pipeline hmmer yang terintegrasi dalam alat seperti METABOLIC atau DRAM, yang memindai prediksi frame pembacaan terbuka terhadap Pfam, TIGRFAM, dan database HMM lainnya untuk menetapkan kategori fungsional.
sumber daya: Lab Lexicon ORF Finder