Macam Mana Semua Ni Berfungsi?
Kenapa nak buat ujian sendiri? Kan dah ada benchmark?
Sebab benchmark yang ada kat luar tu dibuat untuk syarikat yang cipta AI, bukan untuk orang macam kita yang membayar untuk menggunakannya. Benchmark ni cuma jawab soalan macam "mana model AI yang dapat markah paling tinggi untuk set soalan ni?". Benda ni memang berguna kalau kerja awak ialah bina model AI.
Tapi itu bukan soalan kita, kan? Soalan kita lebih kurang macam ni: "Kalau saya ada RM100 sebulan dan saya ada berlambak kerja, subscription mana yang betul-betul boleh tolong saya?" Leaderboard tak boleh jawab benda tu. Kita kena tengok hasil kerja yang dah siap baru kita tahu.
Kenapa guna subscription biasa, bukan developer access?
Selalunya, kebanyakan ujian dibuat menggunakan developer access — awak bayar ikut setiap kali guna, ia cepat jadi mahal, dan cara setup dia pun orang biasa takkan sentuh. Memang jarang sangat orang bekerja macam tu.
Orang biasa selalunya bayar yuran bulanan dan terus guna app tersebut. Cara ni ada had yang ujian biasa tak pernah tunjuk: berapa banyak benda awak boleh buat sebelum kena cap (had penggunaan), apa yang desktop app tu benarkan AI capai, dan macam mana AI tu berfungsi untuk kerja yang panjang. Had-had ni semua adalah sebahagian daripada produk, jadi kita kena uji dari dalam situasi tu.
Macam mana rupa "tugas" yang kita bagi kat AI ni?
Sesuatu yang manusia sebenar nak siapkan, dan cukup besar supaya kita boleh nampak beza antara dua AI. Contohnya: jadikan report setebal 240 muka surat kepada sesuatu yang senang dibaca oleh orang awam. Bina satu tool kecil yang betul-betul berfungsi. Atau tolong selesaikan kerja-kerja admin yang berulang-ulang.
Kita tak buat soalan teka-teki atau soalan perangkap. Kalau kerja tu tak pernah wujud dalam minggu sebenar seseorang, kita takkan masukkan kat sini.
Macam mana sesuatu tugas tu di-run?
Semua AI akan dapat brief (arahan) yang sama, ditulis sekali sahaja, sebelum sesiapa tahu macam mana hasilnya nanti. Setiap AI akan buat kerja guna desktop app masing-masing, sign-in ke plan yang berbayar, dan kita kuatkan thinking setting (tahap pemikiran) dia.
Lepas tu, kita siarkan saja apa yang keluar. Kita tak tulis semula, tak ubah style, tak betulkan kesilapan dia, atau run lagi sekali sampai benda tu nampak lawa. Kalau salah satu AI tu keluarkan benda yang rosak, awak tetap akan tengok benda yang rosak tu — sebab itu pun satu maklumat yang penting.
Apa maksud lajur plan dan harga tu?
Yang ni kena beritahu betul-betul sebab ini benda paling senang orang salah faham.
Plan yang kami senaraikan tu adalah penilaian kami sendiri tentang subscription paling murah yang logik untuk guna AI tu buat kerja sebesar ni. Awak takkan boleh suruh Opus 5 buat kerja berat sepanjang hari guna plan RM20; awak akan kehabisan limit jauh sebelum kerja tu siap. Jadi, kami letakkan tier yang paling sesuai dan harganya sekali.
Ini cuma label yang kami pilih, bukan resit rasmi, dan tak semestinya akaun sebenar yang kami guna masa run kerja tu. Kami buat macam ni supaya awak boleh bandingkan secara adil: kalau dua AI duduk dalam kategori harga yang sama, barulah kita boleh tanya, AI mana yang buat kerja lebih bagus berbaloi dengan duit tu?
Apa benda yang kami MEMANG TAK BUAT?
- Kami tak bagi markah, gred, atau bintang: Nombor-nombor tu cuma pendapat kami yang pakai 'topeng'.
- Kami tak umumkan pemenang: Dua orang boleh tengok jawapan AI yang sama dan masing-masing pilih jawapan yang berbeza, sebab keperluan mereka tak sama.
- Kami tak ambil duit dari syarikat AI: Ujian ni tak ada penaja dan tak di-review oleh syarikat-syarikat tersebut.
- Kami tak sorok hasil yang teruk: Kalau hasil kerja tu lemah, kami biar je kat situ.
Kat mana awak tak patut percaya kami 100%?
Ini cuma ujian kecil yang jujur, bukan eksperimen sains. Beberapa perkara awak kena tahu:
- Setiap hasil tu cuma satu percubaan. Kalau awak tanya lagi esok, awak akan dapat jawapan berbeza.
- Brief tu ditulis oleh manusia. Cara awak bertanya akan mengubah apa yang awak dapat. Ayat orang lain mungkin lebih sesuai untuk AI yang berbeza.
- Ini cuma snapshot (gambaran pada masa itu sahaja). App ni sentiasa berubah setiap beberapa minggu, jadi hasil yang lama tu cuma menceritakan tentang version yang lama.
- Ini adalah citarasa kami. Kami yang pilih nak uji kerja apa dan plan mana, dan kami jujur bagitahu awak daripada berlakon sebaliknya.
Apa yang akan datang lepas ni?
Lebih banyak kerja, merangkumi pelbagai jenis, dan lebih banyak AI dari titik harga yang berbeza — termasuk plan yang lebih murah, supaya perbandingan ni bukan setakat untuk AI yang mahal-mahal je.
Kami juga nak tunjukkan kos dan berapa lama masa yang diambil untuk setiap run, supaya awak boleh nampak dengan jelas berbaloi atau tidak perbandingan antara wang, masa, dan kualiti.