Artikel mendalam tentang teknologi yang membentuk masa depan.

State Space Models vs Transformer: Panduan Praktis

Panduan praktis state space models, Mamba-3, dan arsitektur hybrid: apa yang sudah berhasil, dan kapan sebaiknya dipakai menggantikan transformer.

Sungai yang mengalir elegan di samping jaringan node bercahaya yang padat, melambangkan SSM versus transformer.

Transformer tidak akan jadi satu-satunya pemain utama untuk waktu yang lama lagi. Saya tahu ini klaim yang berani. Kita sudah bertahun-tahun melihat arsitektur transformer mendominasi segalanya, dari model bahasa sampai protein folding. Tapi setelah beberapa bulan terakhir membandingkan state space models dengan baseline transformer pada beban kerja produksi, saya yakin pergeseran ini nyata. Bukan karena SSM selalu lebih baik. Tidak. Tapi karena mereka memecahkan masalah spesifik yang tidak bisa diatasi transformer secara mendasar, dan generasi terbaru sudah menutup cukup banyak kesenjangan kualitas sehingga mengabaikannya sekarang berarti keputusan utang teknis.

Ini bukan tulisan hype. Saya akan membahas apa sebenarnya state space models, di mana Mamba-3 benar-benar memperbaiki keadaan, di mana SSM masih kurang, dan bagaimana tim Anda sebaiknya memikirkan adopsinya. Dari praktisi ke praktisi.

Mengapa Transformer Mentok Saat Skalanya Membesar

Anda sudah tahu cerita skala kuadratik. Self-attention menghitung matriks N×N untuk urutan panjang N, jadi menggandakan panjang konteks melipatgandakan empat kali compute dan memori. Untuk waktu yang lama, ini tidak terlalu jadi masalah. Model berjalan dengan beberapa ribu token, dan hardware masih bisa mengimbangi.

Era itu sudah lewat. Beban kerja yang kita bangun sekarang rutin membutuhkan konteks 100K+ token. Code assistant perlu melihat seluruh repository. Pipeline multimodal mengunyah berjam-jam video. Agent menyimpan riwayat percakapan yang membentang berhari-hari. Di skala ini, attention kuadratik bukan cuma mahal, tapi sudah menjadi tembok.

Masalah KV cache membuatnya makin parah. Selama autoregressive generation, setiap layer transformer menyimpan pasangan key-value untuk setiap token yang pernah dilihatnya. Cache itu tumbuh linear per layer dan cepat memakan memori GPU. Saya pernah melihat transformer 7B menghabiskan 40GB VRAM hanya untuk KV cache pada konteks 128K. Itu memori yang tidak bisa dipakai untuk batching lebih banyak request.

  • Skala memori kuadratik membuat konteks satu juta token hampir mustahil dengan attention standar
  • Pertumbuhan KV cache membatasi jumlah pengguna serentak per GPU, dan ini langsung menjadi pengali biaya dalam produksi
  • Konsumsi energi untuk inferensi transformer konteks panjang mulai sulit dibenarkan
  • Aplikasi real-time (robotika, edge AI) membutuhkan generasi token di bawah milidetik yang tidak bisa dicapai attention
  • Fenomena 'attention sink' menurunkan kualitas pada urutan yang sangat panjang, bahkan saat memori masih tersedia

Ini bukan kekhawatiran teoretis. Ini alasan tiga tim berbeda yang pernah saya ajak kerja mulai serius mengevaluasi alternatif tahun lalu.

Cara Kerja State Space Models Sebenarnya

State space models berasal dari teori kontrol, tempat mereka sudah dipakai selama puluhan tahun untuk memodelkan sistem dinamis. Ide intinya sederhana: alih-alih melihat setiap token sebelumnya untuk menghitung setiap output (seperti yang dilakukan attention), Anda menyimpan hidden state terkompresi yang berkembang seiring waktu. Token baru memperbarui state. State menghasilkan output. Selesai.

Secara matematis, SSM didefinisikan oleh empat matriks, yaitu A, B, C, dan D, yang mengatur bagaimana hidden state h berubah sebagai respons terhadap input x. Anda mendiskretisasi persamaan kontinu untuk data sekuensial, dan hasilnya adalah rekurensi yang sangat sederhana untuk dihitung saat inferensi.

import torch
def ssm_step(A_bar, B_bar, C, D, h, x_t):
"""Single SSM step: O(1) memory, O(1) compute.
Compare this to attention, which needs to look at
every previous token. The SSM just updates its state.
"""
h_new = A_bar @ h + B_bar @ x_t  # Update hidden state
y_t = C @ h_new + D * x_t         # Compute output
return h_new, y_t
def ssm_generate(A_bar, B_bar, C, D, tokens, embed):
"""Autoregressive generation with constant memory.
Whether you've processed 100 tokens or 500,000,
this uses the same amount of memory.
"""
h = torch.zeros(A_bar.shape[0])
outputs = []
for t in tokens:
x_t = embed(t)
h, y_t = ssm_step(A_bar, B_bar, C, D, h, x_t)
outputs.append(y_t)
return torch.stack(outputs)

Keindahannya langsung terlihat di kode. Inferensi memakan memori O(1) dan compute O(1) per token, tidak peduli panjang urutannya. Tidak ada KV cache. Tidak ada ledakan kuadratik. Seluruh riwayat dikompresi ke dalam vektor hidden state.

Tangkapannya? Saat training, menjalankan rekurensi ini secara sekuensial akan sangat lambat. Triknya, komputasi yang sama bisa dirumuskan ulang sebagai konvolusi atau parallel scan, yang ditangani GPU dengan efisien. Jadi Anda mendapat training paralel dan inferensi rekuren, yang terbaik dari keduanya.

Dari Mamba ke Mamba-3: Apa yang Diperbaiki Tiap Generasi

SSM awal seperti S4 membuktikan konsepnya, tapi punya kelemahan kritis: mereka kurang baik dalam penalaran berbasis konten. Matriks transisi state dibuat tetap untuk semua input, jadi model tidak bisa memutuskan apa yang diingat dan dilupakan berdasarkan apa yang sebenarnya sedang dibaca. Ibarat mencatat dengan aturan 'tulis setiap kata ketiga', Anda menangkap beberapa informasi berguna, tapi tidak bisa menyesuaikan dengan apa yang penting.

Mamba, diperkenalkan oleh Albert Gu dan Tri Dao di akhir 2023, memperbaikinya dengan ide yang elegan: membuat parameter SSM bergantung pada input. Alih-alih matriks A, B, C yang tetap, Mamba menghitungnya sebagai fungsi dari token saat ini. Model belajar menyimpan informasi relevan secara selektif dan membuang noise. Mekanisme 'selektif' ini memberi SSM kesadaran konten yang sebelumnya tidak mereka miliki.

Mamba-2 membawa wawasan teoretis bahwa structured SSM dan linear attention secara matematis dual, dalam kerangka State Space Duality (SSD). Ini bukan sekadar akademis. Ini memungkinkan implementasi yang sadar hardware dan memanfaatkan tensor core GPU dengan lebih baik, sehingga throughput training naik signifikan.

Mamba-3 adalah bagian yang menarik dari sudut pandang deployment. Ada tiga inovasi yang paling penting:

  1. Pelacakan state multi-skala: model menjaga state pada beberapa resolusi temporal sekaligus, menangkap pola lokal dan dependensi jarak jauh tanpa mengorbankan salah satunya
  2. Kompresi state adaptif: hidden state mengembang secara dinamis untuk bagian penalaran yang kompleks dan menyusut untuk teks yang mudah ditebak, sehingga menghemat compute tanpa mengorbankan kualitas
  3. Inisialisasi dan gating yang lebih baik: stabilitas training pada skala besar membaik drastis, dan ini sangat penting saat Anda menghabiskan jutaan untuk satu run training

Mamba-3 tidak mengalahkan transformer di setiap benchmark. Dan memang tidak perlu. Model ini menyamai kualitas di sebagian besar evaluasi standar sambil memakai sebagian kecil compute inferensi. Untuk sebagian besar beban kerja produksi, inilah trade-off yang penting.

Linear Attention dan Konvergensinya dengan SSM

Ada jalur paralel yang layak dipahami. Linear attention menyasar masalah efisiensi yang sama, tapi dari dalam kerangka transformer. Attention standar menghitung matriks N×N penuh. Linear attention mengganti softmax dengan fungsi kernel yang bisa didekomposisi, lalu menyusun ulang matematikanya sehingga matriks kuadratik itu tidak pernah benar-benar dibentuk.

# Standard attention: O(N^2 * d)
# score = softmax(Q @ K.T / sqrt(d)) @ V
# Linear attention: O(N * d^2)
# Replace softmax with kernel feature map phi()
# Rearrange: compute K^T @ V first (d×d), then multiply by Q
def linear_attention_step(q_t, running_kv, running_k, k_t, v_t, phi):
"""Incremental linear attention — runs like a recurrence.
This is why SSMs and linear attention are duals:
both compress history into a fixed-size state.
"""
k_feat = phi(k_t)
q_feat = phi(q_t)
running_kv = running_kv + k_feat.unsqueeze(-1) * v_t.unsqueeze(-2)
running_k = running_k + k_feat
y_t = (q_feat @ running_kv) / (q_feat @ running_k + 1e-6)
return y_t, running_kv, running_k

Perhatikan kode itu baik-baik. Linear attention, ketika dijalankan secara inkremental, menjaga state berjalan dan memperbaruinya dengan setiap token baru. Terdengar familiar? Memang, ia melakukan hal yang pada dasarnya sama dengan SSM. Kerangka SSD membuat koneksi ini formal, dan ini salah satu wawasan teoretis terpenting dalam riset pemodelan sekuens belakangan ini.

Arsitektur seperti GLA (Gated Linear Attention) dan varian RetNet mendorong ini lebih jauh, dengan menambahkan gating yang bergantung data sehingga batas antara linear attention dan selective SSM hampir sepenuhnya kabur. Pelajaran praktisnya: jangan anggap ini sebagai pendekatan yang saling bersaing. Keduanya sedang berkonvergensi.

Arsitektur Hybrid: Apa yang Sebenarnya Menang di Produksi

Inilah yang saya sampaikan ke tim yang bertanya apakah mereka harus pindah ke SSM: jangan langsung murni di satu jenis. Arsitektur yang memberikan hasil terbaik saat ini adalah hybrid yang mencampur layer SSM dengan sedikit layer attention. Primitif komputasi yang berbeda unggul di hal yang berbeda, dan berpura-pura sebaliknya hanya membuang performa.

Layer SSM unggul dalam mengompresi dan menyebarkan informasi sekuensial secara efisien. Layer attention tetap tak tertandingi untuk retrieval presisi berbasis konten, misalnya 'temukan baris persis dari halaman 47 yang menjawab pertanyaan ini'. Hybrid yang dirancang dengan baik memakai SSM untuk 80-90% layer dan menaburkan attention di titik yang paling penting.

  • Model gaya Jamba: bergantian layer Mamba dan attention dengan blok feed-forward MoE, merutekan secara dinamis antara pemrosesan SSM yang efisien dan attention yang presisi
  • Desain keluarga Griffin: recurrent gated linear unit dikombinasikan dengan local sliding-window attention, memberi hasil kuat dengan full attention yang minimal
  • Hybrid Mamba-Attention: blok Mamba-3 untuk sebagian besar layer, dengan layer full attention disisipkan pada kedalaman strategis untuk perutean informasi global
  • Penerus StripedHyena: menyisipkan gated convolution, layer SSM, dan sparse attention dalam pola yang dioptimasi NAS

Angka-angkanya mendukung ini. Beberapa kelompok independen menunjukkan bahwa rasio 85/15 antara SSM dan attention menyamai kualitas transformer murni pada jumlah parameter yang sama, sambil memangkas FLOPs inferensi sebesar 40-60%. Penghematan memorinya bahkan lebih besar untuk beban kerja konteks panjang. Ini bukan peningkatan marginal. Ini memangkas tagihan GPU Anda menjadi setengahnya.

Benchmark Produksi: Di Mana SSM Unggul dan Di Mana Tidak

Biar saya spesifik soal angkanya, karena klaim efisiensi yang kabur tidak berguna bagi siapa pun yang sedang membuat keputusan deployment.

Throughput inferensi: model berbasis Mamba-3 dengan 8B parameter menghasilkan token dengan kecepatan yang sama, baik konteksnya 1K maupun 500K token. Transformer sebanding melambat secara bertahap seiring membesarnya KV cache. Pada konteks 500K, model SSM memberikan throughput 5-8x lebih tinggi per GPU. Ini bukan teori. Saya sendiri yang mengukurnya.

Pengguna serentak: tanpa KV cache, model SSM bisa melayani jauh lebih banyak request simultan. Pada satu A100, di mana transformer mungkin hanya menangani 8 stream serentak pada konteks 32K, model SSM yang setara bisa menangani 30+. Bagi siapa pun yang menjalankan inferensi dalam skala besar, ini angka yang mengubah ekonomi.

Kecepatan training: keuntungannya di sini lebih sederhana. Mamba-3 berlatih sekitar 1,4x throughput transformer yang setara pada klaster H100. Selisihnya melebar untuk urutan yang lebih panjang. Di atas 32K token, training SSM berjalan 2-3x lebih cepat karena menghindari attention kuadratik sepenuhnya.

Tapi di sini saya harus jujur soal keterbatasannya. Pada tugas yang membutuhkan recall verbatim yang presisi dari konteks panjang, misalnya 'apa pesan error persisnya di baris 4.382?', SSM murni masih kalah. State terkompresi berukuran tetap adalah representasi yang lossy. Attention bisa langsung melihat kembali ke token asli. Inilah alasan arsitektur hybrid bekerja: layer attention menangani retrieval yang tidak bisa dilakukan SSM.

Di Mana SSM Masih Kurang

Saya ingin jernih soal celah yang tersisa, karena mengadopsi arsitektur baru berdasarkan informasi yang belum lengkap adalah cara yang bagus untuk membuang enam bulan.

  1. In-context learning: transformer masih lebih baik dalam menyesuaikan perilaku berdasarkan contoh few-shot di prompt. SSM bisa melakukannya, tapi kurang andal. Jika aplikasi Anda sangat bergantung pada prompt engineering dengan contoh, SSM murni akan mengecewakan Anda.
  2. Kematangan ekosistem: tooling transformer sudah dioptimasi selama bertahun-tahun. Kernel khusus SSM, infrastruktur serving, dan library fine-tuning berkembang cepat tapi belum setara. Sisihkan waktu integrasi ekstra.
  3. Ketidakpastian skala di atas 70B: model Mamba-3 hingga 70B parameter menunjukkan kurva skala yang baik, tapi kita belum punya data kuat di rentang 200B+ ke atas. Apakah hukum skala SSM tetap berlaku pada ukuran ekstrem memang belum diketahui.
  4. Teknik fine-tuning: LoRA dan QLoRA untuk transformer sudah dipahami dengan baik. Menerapkannya pada arsitektur SSM membutuhkan pendekatan yang berbeda, dan praktik terbaiknya masih terus terbentuk.
  5. Ketidakcocokan hardware: GPU saat ini dioptimasi untuk perkalian matriks yang disukai attention. SSM sangat bergantung pada parallel scan, yang berjalan cukup baik di hardware modern tapi bukan operasi yang menjadi dasar desain GPU.

Tidak ada satu pun dari ini yang jadi penghalang utama. Ini masalah engineering dengan jalur solusi yang sudah diketahui. Tapi ini nyata, dan harus diperhitungkan dalam timeline Anda.

Rekomendasi Praktis: Kapan Mengadopsi dan Cara Memulainya

Setelah mengevaluasi SSM di berbagai beban kerja produksi, inilah kerangka yang saya pakai saat memberi saran ke tim.

Adopsi secara agresif jika beban kerja Anda melibatkan inferensi konteks panjang (rutin 32K+ token), kebutuhan konkurensi tinggi, atau deployment edge yang sensitif terhadap latensi. ROI-nya besar dan langsung terasa. Mulailah dengan arsitektur hybrid seperti Jamba atau model keluarga Griffin, bukan SSM murni. Anda tetap mendapat sebagian besar keuntungan efisiensi dengan risiko yang lebih kecil.

Tunggu dan pantau jika beban kerja Anda didominasi konteks pendek dengan ketergantungan berat pada in-context learning, dan Anda tidak punya tekanan biaya inferensi. Transformer masih unggul di sini, dan ekosistemnya lebih matang.

  • Profilkan beban kerja inferensi Anda yang sebenarnya sebelum memutuskan. Median panjang konteks dan jumlah pengguna serentak adalah variabel kuncinya
  • Mulai dengan arsitektur hybrid, bukan SSM murni. Risikonya lebih rendah dan tetap memberikan pengurangan biaya inferensi 40-60%
  • Benchmark pada tugas spesifik Anda. SSM unggul di summarization dan penalaran jarak jauh, tapi tertinggal di retrieval yang presisi
  • Bangun infrastruktur perbandingan arsitektur sekarang. Anda perlu mengukur latensi, throughput, memori, dan biaya per query, bukan hanya akurasi
  • Pantau ekosistem tooling SSM setiap kuartal. Laju perbaikannya cukup cepat sehingga sesuatu yang belum praktis hari ini bisa siap produksi dalam tiga bulan

Lanskap Arsitektur Sedang Terpecah, dan Itu Hal yang Baik

Era satu arsitektur untuk menguasai semuanya sedang berakhir. Kita menuju dunia di mana tim memilih primitif komputasi (full attention, linear attention, selective SSM, gated convolution) dan menyusunnya sesuai batasan spesifik mereka. Begitulah disiplin engineering yang matang bekerja. Anda tidak membangun setiap struktur dari baja. Anda memilih material berdasarkan beban yang harus ditanggungnya.

Transformer belum mati. Ia tetap arsitektur yang paling terbukti untuk banyak beban kerja, dan akan menggerakkan sistem AI kritis selama bertahun-tahun. Tapi monopolinya atas pemodelan sekuens state-of-the-art sudah berakhir. SSM dan hybrid sudah layak menjadi alat produksi kelas satu, bukan sekadar rasa ingin tahu riset.

Bagi kita yang membangun sistem nyata, lebih banyak pilihan arsitektur berarti alat yang lebih baik untuk masalah spesifik. Ini bukan disrupsi yang perlu ditakuti. Ini daya ungkit engineering yang perlu dimanfaatkan.