Setelah Transformer: Arsitektur AI Apa Berikutnya?
Biaya kuadratik self-attention pada transformer itu hambatan nyata. Linear attention, attention residuals, dan arsitektur hibrida menunjukkan arah berikutnya.

Arsitektur transformer sudah menggerakkan AI selama delapan tahun. Setiap model bahasa besar utama, sebagian besar sistem pembuat gambar, dan semakin banyak model audio dan video dibangun di atas mekanisme self-attention yang diperkenalkan dalam paper 'Attention Is All You Need'. Tapi self-attention punya masalah mendasar: biaya komputasi dan memorinya tumbuh secara kuadratik seiring panjang sekuens. Gandakan panjang input, biayanya naik empat kali lipat.
Untuk sekuens pendek, ini tidak masalah. Tapi untuk jendela konteks 128K token yang sedang kita kejar, dan jendela satu juta token yang diinginkan banyak orang, ini jadi hambatan serius. Gelombang riset baru mengeksplorasi alternatifnya: attention residuals yang menggunakan ulang komputasi antar layer, varian linear attention yang menghilangkan biaya kuadratik, dan arsitektur hibrida yang mencampur attention dengan mekanisme yang lebih murah. Transformer tidak akan hilang, tapi bentuknya sedang diubah.
Kenapa Self-Attention Itu Mahal
Untuk memahami alternatifnya, kamu perlu paham apa sebenarnya yang dihitung self-attention. Dengan sekuens N token, self-attention menghitung skor relevansi antara setiap pasangan token. Token 1 vs token 2, token 1 vs token 3, ..., token 1 vs token N, lalu token 2 vs semua token lainnya, dan seterusnya. Jadi totalnya N² pasangan.
import torch
import torch.nn.functional as F
def self_attention(Q, K, V):
"""
Standard self-attention.
Q, K, V: (batch, seq_len, d_model)
The attention matrix is seq_len × seq_len.
For seq_len = 1024: ~1M entries (manageable)
For seq_len = 32768: ~1B entries (expensive)
For seq_len = 131072: ~17B entries (very expensive)
"""
d_k = Q.size(-1)
# This matmul creates the N×N attention matrix
scores = torch.matmul(Q, K.transpose(-2, -1)) / (d_k ** 0.5)
weights = F.softmax(scores, dim=-1)
return torch.matmul(weights, V)
Pada 4K token, matriks attention punya 16 juta entri, dan GPU modern masih santai menghadapinya. Pada 128K token, jumlahnya jadi 16 miliar entri. Pada 1 juta token, lebih dari satu triliun. Bahkan dengan Flash Attention (yang tidak mengurangi komputasi, tapi memperbaiki pola akses memori secara signifikan), skalasi kuadratik pada akhirnya tetap menang.
Inilah sebabnya transformer awal dibatasi di 512 atau 1024 token. Setiap generasi hardware dan optimasi terus menaikkan batasnya, tapi kita sedang melawan tembok matematika. Skalasi linear (O(N)) secara fundamental lebih baik daripada skalasi kuadratik (O(N²)), dan itulah yang dikejar sebagian besar arsitektur alternatif.
Attention Residuals: Memakai Ulang Komputasi yang Sudah Ada
Salah satu pendekatan paling pragmatis untuk menekan biaya attention justru tidak menggantikan attention. Pendekatan ini membuat setiap layer attention lebih murah dengan memakai ulang komputasi dari layer sebelumnya.
Pengamatannya begini: di transformer yang dalam (misalnya 32 layer), pola attention di layer yang berdampingan sering kali sangat mirip. Layer 15 dan layer 16 cenderung memperhatikan posisi yang sama, dengan sedikit penyesuaian. Menghitung ulang matriks attention N² penuh dari nol di setiap layer itu mubazir, karena sebagian besar kerjanya sudah dilakukan satu layer sebelumnya.
Attention residuals memanfaatkan ini dengan menghitung pola attention 'residual': selisih antara apa yang ingin diperhatikan layer ini dan apa yang sudah dihitung layer sebelumnya. Kalau selisihnya kecil (dan biasanya memang kecil di layer tengah), komputasinya jadi lebih murah. Pola attention penuh adalah jumlah pola layer sebelumnya ditambah residual layer saat ini.
Ini mirip cara kerja kompresi video: daripada menyimpan setiap frame secara independen, kamu menyimpan satu keyframe lalu serangkaian selisih (residual) dari keyframe itu. Selisihnya biasanya jauh lebih kecil dari frame penuh, sehingga kompresinya jauh lebih efisien.
Dalam praktiknya, attention residuals memangkas biaya komputasi attention sebesar 30-50% di layer tengah model dalam, dengan dampak kualitas yang minim. Beberapa layer pertama dan terakhir tetap butuh attention penuh (karena pola mereka lebih khas), tapi layer tengah, yang jumlahnya mayoritas, mendapat percepatan yang signifikan.
Linear Attention: Menghilangkan Biaya Kuadratik
Varian linear attention berusaha merumuskan ulang attention agar skalanya O(N), bukan O(N²). Pendekatan umumnya: alih-alih menghitung matriks attention N×N secara eksplisit, cari cara menghitung output yang sama (atau mendekati sama) menggunakan operasi linear.
Trik matematisnya bergantung pada dekomposisi kernel dari softmax. Attention standar menghitung softmax(QK^T)V. Jika softmax diganti dengan fungsi kernel lain yang bisa didekomposisi menjadi φ(Q) · φ(K)^T, urutan komputasinya bisa diatur ulang: alih-alih (φ(Q) · φ(K)^T) · V (yang punya hasil antara N×N), hitung φ(Q) · (φ(K)^T · V) (yang punya hasil antara d×d, dengan d adalah dimensi model). Karena d << N untuk sekuens panjang, cara ini jauh lebih murah.
def linear_attention(Q, K, V, feature_map=None):
"""
Linear attention via kernel feature maps.
Cost: O(N * d^2) instead of O(N^2 * d)
"""
if feature_map is None:
# ELU+1 is a common choice (from Katharopoulos et al.)
feature_map = lambda x: F.elu(x) + 1
Q = feature_map(Q) # (batch, seq_len, d)
K = feature_map(K) # (batch, seq_len, d)
# Key insight: compute K^T @ V first (d × d matrix)
# instead of Q @ K^T first (N × N matrix)
KV = torch.einsum('bnd,bnm->bdm', K, V) # (batch, d, d)
# Then multiply by Q
output = torch.einsum('bnd,bdm->bnm', Q, KV) # (batch, N, d)
# Normalize
Z = torch.einsum('bnd,bd->bn', Q, K.sum(dim=1)) # normalization
output = output / Z.unsqueeze(-1)
return output
Masalahnya, mengganti softmax dengan fungsi kernel lain mengubah distribusi attention, dan model yang dilatih dengan softmax attention belum tentu berfungsi baik saat dipindah ke linear attention. Celah kualitasnya sudah menyempit signifikan. Varian linear attention terbaru mencapai 95-98% kualitas softmax attention, tapi celahnya tetap ada, terutama pada tugas yang butuh pencarian presisi untuk dependensi jarak jauh.
State Space Models: Paradigma yang Berbeda
State space models (SSM) seperti Mamba mengambil pendekatan yang secara fundamental berbeda. Alih-alih menghitung relasi berpasangan antar token, mereka memproses sekuens lewat rekurensi, yakni dengan menjaga hidden state berukuran tetap yang diperbarui di setiap token. Secara inheren ini O(N): memproses dua kali lipat token membutuhkan waktu dua kali lipat, bukan empat kali.
Inovasi di SSM modern adalah membuat parameter rekurensinya bergantung pada input (selective state spaces). Ini memberi model semacam attention berbasis konten: ia bisa 'memilih' informasi mana yang diingat dan mana yang dilupakan, tanpa biaya kuadratik. Model gaya Mamba menyamai kualitas transformer di banyak benchmark, sambil jauh lebih cepat untuk sekuens panjang.
Trade-off-nya: SSM memproses token secara berurutan, sehingga lebih sulit diparalelkan saat training dibanding transformer (yang bisa memproses semua token sekaligus). Efisiensi training itu penting. Model yang 2x lebih cepat saat inferensi tapi 3x lebih lambat saat training belum tentu menang, karena sebagian besar total komputasi habis untuk training.
Arsitektur Hibrida: Jalan yang Pragmatis
Tren saat ini di model produksi adalah arsitektur hibrida yang menggabungkan beberapa mekanisme attention. Alasannya sederhana: bagian-bagian berbeda dari sebuah model diuntungkan oleh jenis komputasi yang berbeda.
- Full attention untuk penalaran global. Beberapa layer perlu memperhatikan seluruh sekuens, misalnya menemukan konteks relevan yang berjarak ribuan token. Layer ini tetap memakai self-attention standar (mungkin yang dioptimasi dengan Flash).
- Local attention untuk konteks terdekat. Banyak layer terutama memperhatikan token di sekitarnya (sliding window attention). Dengan jendela tetap 256-1024 token, biayanya turun menjadi O(N·W), dengan W adalah ukuran jendela.
- Linear attention untuk konteks luas. Beberapa layer perlu mengagregasi informasi dari seluruh sekuens tapi tidak butuh bobot attention yang presisi. Linear attention menyediakannya dengan biaya O(N).
- Layer SSM untuk pemrosesan berurutan. Layer gaya Mamba bisa memproses dependensi berurutan secara efisien tanpa komputasi attention sama sekali.
Model seperti Jamba (AI21) dan berbagai arsitektur riset bergantian menggunakan mekanisme ini sesuai peran layer. Layer awal memakai local attention (memproses sintaksis dan pola lokal). Layer tengah memakai linear attention atau SSM (membangun representasi yang lebih luas). Beberapa layer strategis memakai full attention (penalaran global dan retrieval). Hasilnya, skalasi keseluruhan mendekati linear sambil tetap menjaga kualitas model yang memang membutuhkan full attention.
Yang Perlu Diperhatikan Developer
Kalau kamu membangun aplikasi di atas model bahasa, perubahan arsitektur di baliknya berdampak nyata pada pekerjaanmu.
- Jendela konteks akan terus membesar. Saat biaya attention turun, jendela konteks ikut melebar. Ini mengubah arsitektur aplikasi: alih-alih membangun pipeline RAG yang rumit agar konteks relevan muat di jendela 4K, kamu mungkin cukup memasukkan semuanya ke prompt 1 juta token. Kesederhanaannya menggoda, tapi implikasi latensi dan biayanya berbeda antar arsitektur.
- Profil latensi berubah. Transformer punya latensi yang relatif datar sampai titik tertentu, lalu naiknya kuadratik. Model linear-attention dan SSM punya kenaikan latensi yang lebih landai dan linear. Untuk aplikasi yang sensitif terhadap waktu respons, memahami perilaku skalasi model kamu itu penting.
- Perbedaan kualitas bergantung pada tugas. Model linear attention mungkin sedikit kalah pada tugas yang membutuhkan pengambilan informasi presisi dari posisi tertentu dalam konteks panjang ('apa item ketiga di daftar halaman 47?'). Untuk tugas yang butuh pemahaman umum, performanya setara. Kenali use case kamu.
- Optimasi inferensi makin penting. Seiring model makin kompleks secara arsitektur (mencampur berbagai jenis attention), inference engine harus menangani komputasi yang heterogen dengan efisien. vLLM, TensorRT-LLM, dan framework serupa sedang beradaptasi, tapi arsitektur kustom mungkin belum langsung didukung.
Transformer tidak sedang digantikan, tapi sedang berevolusi. Self-attention tetap mekanisme paling ekspresif yang kita punya untuk memodelkan relasi antar token. Tapi ia tidak harus dipakai di mana-mana, di setiap layer, dengan biaya N² penuh. Model beberapa tahun ke depan akan menggunakan attention secara presisi: presisi penuh di bagian yang paling penting, dan alternatif yang lebih murah di tempat lainnya. Hasilnya adalah model yang lebih cepat, mampu menangani konteks lebih panjang, dan lebih murah dijalankan, sambil menyamai atau melampaui kualitas saat ini. Ini layak untuk diperhatikan.


