Bagaimana VibeBench Menguji Kerja Sebenar?
Apa sebenarnya yang VibeBench ukur?
Benchmark biasa mengukur kemampuan model. VibeBench menguji kemampuan menyiapkan kerja. Kami mahu tahu sama ada sesuatu model, pelan atau agent boleh menghasilkan output yang boleh digunakan, pada kos dan masa yang munasabah.
Soalan utama kami bukan “AI mana paling tinggi dalam leaderboard?”. Soalannya ialah: “AI mana, pada kos berapa, boleh menyiapkan kerja ini dengan standard yang diperlukan?”
Apa yang diuji dalam siri semasa?
Siri semasa menguji model melalui pelan langganan dan desktop app yang digunakan untuk menyiapkan kerja tersebut. Ini membolehkan kami melihat bukan sahaja kualiti model, tetapi juga had penggunaan, akses kepada fail dan kemampuan mengekalkan kerja yang panjang.
Skop ini penting untuk dibaca dengan tepat: hasil semasa ialah bukti tentang model, pelan dan app yang diuji. Ia belum mewakili keseluruhan sistem atau workflow sesebuah company.
Macam mana rupa "tugas" yang kita bagi kat AI ni?
Sesuatu yang manusia sebenar nak siapkan, dan cukup besar supaya kita boleh nampak beza antara dua AI. Contohnya: jadikan report setebal 240 muka surat kepada sesuatu yang senang dibaca oleh orang awam. Bina satu tool kecil yang betul-betul berfungsi. Atau tolong selesaikan kerja-kerja admin yang berulang-ulang.
Kita tak buat soalan teka-teki atau soalan perangkap. Kalau kerja tu tak pernah wujud dalam minggu sebenar seseorang, kita takkan masukkan kat sini.
Macam mana sesuatu tugas tu di-run?
Semua AI akan dapat brief (arahan) yang sama, ditulis sekali sahaja, sebelum sesiapa tahu macam mana hasilnya nanti. Setiap AI akan buat kerja guna desktop app masing-masing, sign-in ke plan yang berbayar, dan kita kuatkan thinking setting (tahap pemikiran) dia.
Lepas tu, kita siarkan saja apa yang keluar. Kita tak tulis semula, tak ubah style, tak betulkan kesilapan dia, atau run lagi sekali sampai benda tu nampak lawa. Kalau salah satu AI tu keluarkan benda yang rosak, awak tetap akan tengok benda yang rosak tu — sebab itu pun satu maklumat yang penting.
Bagaimana kami gunakan plan dan harga?
Harga ialah filter kedua, selepas tugas dan standard output. Yang ni kena beritahu betul-betul sebab ini benda paling senang orang salah faham.
Plan yang kami senaraikan tu adalah penilaian kami sendiri tentang subscription paling murah yang logik untuk guna AI tu buat kerja sebesar ni. Awak takkan boleh suruh Opus 5 buat kerja berat sepanjang hari guna plan RM20; awak akan kehabisan limit jauh sebelum kerja tu siap. Jadi, kami letakkan tier yang paling sesuai dan harganya sekali.
Ini cuma label yang kami pilih, bukan resit rasmi, dan tak semestinya akaun sebenar yang kami guna masa run kerja tu. Kami buat macam ni supaya awak boleh bandingkan secara adil: kalau dua AI duduk dalam kategori harga yang sama, barulah kita boleh tanya, AI mana yang buat kerja lebih bagus berbaloi dengan duit tu?
Apa benda yang kami MEMANG TAK BUAT?
- Kami tak bagi markah, gred, atau bintang: Nombor-nombor tu cuma pendapat kami yang pakai 'topeng'.
- Kami tak umumkan pemenang: Dua orang boleh tengok jawapan AI yang sama dan masing-masing pilih jawapan yang berbeza, sebab keperluan mereka tak sama.
- Kami tak ambil duit dari syarikat AI: Ujian ni tak ada penaja dan tak di-review oleh syarikat-syarikat tersebut.
- Kami tak sorok hasil yang teruk: Kalau hasil kerja tu lemah, kami biar je kat situ.
Kat mana awak tak patut percaya kami 100%?
Ini cuma ujian kecil yang jujur, bukan eksperimen sains. Beberapa perkara awak kena tahu:
- Setiap hasil tu cuma satu percubaan. Kalau awak tanya lagi esok, awak akan dapat jawapan berbeza.
- Brief tu ditulis oleh manusia. Cara awak bertanya akan mengubah apa yang awak dapat. Ayat orang lain mungkin lebih sesuai untuk AI yang berbeza.
- Ini cuma snapshot (gambaran pada masa itu sahaja). App ni sentiasa berubah setiap beberapa minggu, jadi hasil yang lama tu cuma menceritakan tentang version yang lama.
- Ini adalah citarasa kami. Kami yang pilih nak uji kerja apa dan plan mana, dan kami jujur bagitahu awak daripada berlakon sebaliknya.
Apa yang akan datang lepas ni?
Lebih banyak kerja, merangkumi pelbagai jenis, dan lebih banyak AI dari titik harga yang berbeza — termasuk plan yang lebih murah, supaya perbandingan ni bukan setakat untuk AI yang mahal-mahal je.
Kami juga nak tunjukkan kos dan berapa lama masa yang diambil untuk setiap run, supaya awak boleh nampak dengan jelas berbaloi atau tidak perbandingan antara wang, masa, dan kualiti.