Skip to content

Article image
Basis Data NCBI: GenBank, RefSeq, dan SRA

May 16, 2026

Gambaran Umum

Pusat Nasional Informasi Bioteknologi (NCBI) di Perpustakaan Kedokteran Nasional AS menyediakan rangkaian basis data biologi molekuler paling komprehensif di dunia. GenBank, repositori sekuens nukleotida utama, menerima kiriman langsung dari peneliti dan berpartisipasi dalam Kolaborasi Internasional Basis Data Sekuens Nukleotida (INSDC) bersama EMBL-EBI dan DDBJ. RefSeq menyediakan sekuens referensi yang dikurasi dan non-redundan untuk genom, transkrip, dan protein. Arsip Bacaan Sekuensing (SRA) menyimpan bacaan sekuensing mentah dari platform throughput tinggi. Bersama-sama, sumber daya ini membentuk tulang punggung akses data molekuler publik.

Konsep Kunci

Catatan GenBank mencakup sekuens mentah, anotasi biologis, dan metadata bibliografi. Nomor akses (mis., NM_001234) menyediakan pengenal stabil untuk sitasi. RefSeq berbeda dari GenBank dalam proses kurasi: catatan RefSeq ditinjau dan dipelihara secara manual, menawarkan keandalan yang lebih tinggi untuk tujuan referensi. SRA mengarsipkan bacaan sekuensing yang belum diproses dalam format terkompresi, menyimpan data bacaan dan skor kualitas. Sistem pencarian Entrez menyediakan pencarian terpadu lintas basis data di semua sumber daya NCBI, memungkinkan pengambilan catatan terkait dari berbagai basis data melalui satu antarmuka.

Aplikasi

Basis data NCBI digunakan setiap hari oleh peneliti di seluruh dunia. Proyek sekuensing DNA dimulai dengan pencarian BLAST terhadap GenBank untuk mengidentifikasi sekuens yang tidak diketahui. Eksperimen sekuensing generasi berikutnya menyimpan bacaan mentah di SRA dan menyelaraskannya terhadap genom RefSeq untuk deteksi varian. Studi genetika bakteri mengandalkan genom RefSeq untuk genomik komparatif dan identifikasi gen spesifik spesies serta faktor virulensi.

Protokol Praktis

Menavigasi portal NCBI dimulai di ncbi.nlm.nih.gov, di mana bilah pencarian menyediakan akses ke sistem pencarian lintas basis data Entrez. Untuk menemukan semua sekuens nukleotida untuk organisme tertentu, masukkan nama organisme (mis., “Escherichia coli”) di bilah pencarian utama, lalu gunakan filter basis data “Nucleotide” di halaman hasil. Untuk pencarian yang lebih presisi, gunakan sintaks bidang Entrez: “Escherichia coli[Organism] AND 16S ribosomal RNA[Title]” hanya mengembalikan sekuens rRNA 16S dari E. coli. Daftar hasil menunjukkan nomor akses, panjang sekuens, dan definisi. Klik nomor akses mana pun (mis., NR_024570) untuk melihat catatan GenBank lengkap dengan fitur yang dianotasi, sekuens pengkode, dan referensi. Untuk pengambilan batch, klik “Send to” > “File” > “FASTA” untuk mengunduh semua sekuens yang cocok. Sebagai contoh praktis, seorang mikrobiolog yang mengkarakterisasi isolat bakteri baru akan: (1) mencari di SRA bacaan mentah dari spesies yang terkait erat untuk digunakan sebagai referensi perakitan, (2) mengirimkan kontig yang dirakit ke BLAST terhadap basis data genom RefSeq untuk mengidentifikasi kerabat terdekat yang telah diurutkan, (3) mengunduh genom RefSeq dari kerabat tersebut untuk prediksi gen dengan alat seperti Prokka, dan (4) menyimpan perakitan yang dianotasi di GenBank dengan akses baru. Seluruh alur kerja, mencari, mengambil, menganalisis, dan mengirimkan, beroperasi dalam ekosistem NCBI yang terpadu, dengan Entrez menyediakan navigasi lintas basis data yang mulus di setiap langkah. Misalnya, pencarian PubMed untuk patogen yang diminati langsung terhubung ke catatan Nucleotide untuk genomnya, ke SRA untuk data sekuensing yang tersedia, dan ke BioProject untuk metadata eksperimental, semuanya tanpa meninggalkan portal NCBI.