Model murah belum tentu murah
Setiap model AI minta bayaran dalam bentuk berbeza
Setiap kali model baru keluar, dua soalan ni yang paling hangat orang bincangkan:
"Model tu power tak?"
"Model tu murah tak?"
Beberapa minggu ni saya menguji beberapa model untuk kerja sebenar, dan saya rasa dua soalan tu tak cukup untuk jawab persoalan sebenar kita.
Persoalan sebenar duduk di tengah-tengah dua soalan tadi:
"Model mana paling bagus untuk kos yang saya ada sekarang?"
Sebab harga model dan kos untuk menggunakan model sebenarnya dua benda yang berbeza.
Bermula daripada satu claim
Saya terbaca orang kata GPT-5.6 Luna Max hampir setara dengan kualiti Sol.
Luna adalah pilihan paling murah dalam family GPT terkini, dihargakan 80% lebih rendah daripada Sol. Kebiasaannya bila kita dengar murah, kita terus andaikan kualitinya rendah.
Jadi claim tu memang buat saya nak cuba sendiri.
Untuk menggunakannya, Max reasoning perlu diaktifkan dahulu dalam Codex.
Selepas beberapa kali cuba, saya setuju hasilnya memang high quality.
Cuma ada satu perkara yang jarang disebut dalam claim tu: ia lambat.
Menariknya, OpenAI sendiri meletakkan Luna sebagai model paling laju dalam family tu. Tetapi bila Max reasoning dihidupkan, model paling laju jadi model yang paling lama saya tunggu.
Tiga model, kerja yang sama
Selama ini saya banyak guna Sol. Kemudian saya cuba Terra dan Luna Max untuk kerja yang sama.
Result akhir Sol dan Terra sebenarnya okay, dan tak jauh beza seperti yang saya sangka.
Luna Max pula menghasilkan kerja yang berkualiti tinggi, tetapi saya kena tunggu lebih lama untuk dapat hasilnya.
Kalau kita berhenti di situ, nampak macam ketiga-tiganya lebih kurang sama sahaja kan?
Perbezaan yang saya rasa sebenarnya bukan pada hasil akhir.
Ia pada berapa banyak kerja yang saya kena buat untuk sampai ke hasil akhir itu.
Setiap model minta bayaran dalam bentuk berbeza
Sol boleh faham prompt pendek dengan lebih tepat. Saya bagi arahan ringkas, dia terus tangkap apa yang saya maksudkan.
Terra pula perlukan penerangan yang lebih panjang. Kalau saya malas nak jelaskan, hasilnya mula lari.
Cara paling mudah saya gambarkan: Sol macam senior staff, Terra macam junior staff.
Kedua-duanya boleh siapkan kerja. Cuma junior staff perlukan lebih banyak masa kita di depan.
Luna Max pula tempatnya lain sekali. Untuk sampai ke kualiti yang sama, ini yang saya bayar:
GPT-5.6 Sol. Kos paling tinggi. Perhatian paling sedikit. Prompt pendek pun jalan, dan hasil pertama selalunya dah boleh pakai.
GPT-5.6 Terra. Kos sederhana. Perhatian paling banyak. Saya kena siapkan prompt yang lebih panjang di awal, dan lepas hasil keluar pun saya kena touch up beberapa kali sebelum ia setanding Sol.
GPT-5.6 Luna Max. Kos paling rendah. Perhatian sederhana. Tetapi saya kena tunggu jauh lebih lama untuk satu hasil.
Di sini ada satu perkara yang saya salah anggap pada mulanya.
Saya ingat Terra cepat, sebab setiap kali saya tekan enter, jawapan datang cepat.
Sebenarnya tak. Kalau saya kira dari mula saya buka kerja tu sampai hasilnya betul-betul boleh guna, Terra selalunya makan masa paling lama antara ketiga-tiganya.
Masa tu cuma tak nampak, sebab ia berselerak. Sikit masa menulis prompt yang lebih terperinci di awal. Sikit lagi masa membaca hasil dan cari apa yang lari. Sikit lagi masa membetulkan. Ulang beberapa kali.
Luna Max pula masanya terkumpul di satu tempat. Saya tunggu lama, tetapi saya tunggu sekali sahaja.
Jadi bila kita cakap satu model tu cepat, kita kena jelas cepat pada bahagian mana. Cepat memberi respons dan cepat menyiapkan kerja bukan benda yang sama.
Tiga model, tiga jenis bayaran. Duit, perhatian, atau masa menunggu.
Tak ada satu pun yang percuma. Kita cuma pilih mana satu yang kita paling sanggup bayar hari ni.
Ini pengalaman saya menggunakannya, bukan ujian yang saya rekod secara formal. Jadi ambil ia sebagai pemerhatian, bukan skor.
Menunggu ada dua jenis
Ini bahagian yang saya rasa paling ramai terlepas pandang.
Bila kita cakap satu model tu lambat, kita anggap lambat tu satu benda sahaja. Sebenarnya ia dua benda yang sangat berbeza.
Kalau kerja tu boleh ditinggalkan, menunggu hampir tak berkos. Bagi arahan, tutup laptop, pergi buat benda lain, balik tengok hasil. Lambat tak menyakitkan sebab kita tak duduk menunggu pun.
Tetapi kalau kerja tu perlu diulang beberapa kali sebelum betul, menunggu jadi mahal. Setiap kitaran jadi panjang, dan kita kena darab panjang tu dengan berapa kali kita kena ulang.
Jadi soalannya bukan “saya ada masa tak nak tunggu?”
Soalannya: kerja ni jenis hantar sekali siap, atau jenis kena duduk dan ulang?
Untuk kerja jenis pertama, model lambat yang murah selalunya pilihan terbaik.
Untuk kerja jenis kedua, model yang laju dan faham cepat berbaloi walaupun kita bayar lebih.
Kos yang benchmark tak tunjuk
Benchmark rasmi biasanya mengukur satu benda sahaja: hasil model.
Tetapi bila kita betul-betul guna model untuk kerja, ada kos lain yang kita bayar:
- masa menyediakan prompt;
- berapa kali kita kena betulkan salah faham;
- berapa rapat kita kena pantau agent semasa ia bekerja;
- berapa lama kita tersekat menunggu sebelum boleh teruskan kerja.
Semua ni tak muncul dalam harga per token.
Dan satu lagi perkara yang jarang disebut: harga token tu belum tentu kos anda pun.
Kalau anda guna API atau coding agent, ya, harga token memang kos sebenar anda.
Tetapi kalau anda guna subscription macam ChatGPT Plus, harga token bukan kos anda langsung. Kos anda ialah limit penggunaan dan masa anda sendiri. Model yang lambat tak buat bil anda naik. Ia cuma makan hari anda.
Di sinilah Vibebench masuk
Vibebench menjawab persoalan yang lebih dekat dengan kita:
"Dengan bajet sebulan yang saya ada dan jenis kerja yang saya buat, plan mana yang patut saya langgan?"
Vibebench kini sudah live. Untuk setiap use case, kami jalankan kerja yang sama merentasi beberapa model, kemudian susun keputusannya mengikut bajet.
Jadi anda boleh terus pergi ke tahap harga anda dan tengok hasil sebenar setiap model pada tahap tu, bukan sekadar satu leaderboard.
Use case pertama ialah data analysis dan visualization, berdasarkan complete case file RCI Tabung Haji.
Daripada ujian tu, pendapat saya untuk bajet $20 sebulan, ChatGPT Plus dengan GPT-5.6 Luna Max adalah pilihan terbaik.
Kualitinya hampir sama dengan Claude Opus 5 High dan GPT-5.6 Sol High. Cuma ia lebih perlahan.
Dan untuk kerja jenis ni, perlahan tu boleh diterima. Saya hantar kerja, tinggalkan, kemudian balik tengok hasil.
Satu peringatan: ini review berdasarkan penggunaan sebenar, bukan ujian saintifik. Ia juga baru meliputi satu jenis kerja. Untuk coding, writing atau kerja lain, jawapannya mungkin berbeza.
Final Takeaway
Harga token ialah kos model.
Masa menunggu, masa memberi arahan dan perhatian kita ialah kos menggunakan model.
Model yang paling bagus untuk kos yang anda ada bukan semestinya model yang paling murah, paling laju atau paling tinggi dalam benchmark.
Ia bergantung pada satu soalan yang cuma anda boleh jawab:
"Antara duit, perhatian dan masa menunggu, mana satu yang paling mahal untuk anda minggu ni?"