VibeBench — Benchmark untuk kerja sebenar | PandaiTech

VibeBench · Evidence Lab PandaiTech

Benchmark untuk kerja sebenar.

Kami menguji model dan pelan AI pada tugas sebenar—supaya team boleh memilih berdasarkan hasil, masa dan kos, bukan leaderboard.

VibeBench menguji apa yang berfungsi. PandaiTech membina apa yang berfungsi.

Bagaimana kami jalankan ujian ini

Pilih mengikut kerja

Hasil Kerja Sebenar

AI mana, pada kos berapa, boleh menyiapkan kerja ini dengan standard yang diperlukan? Semak output penuh dan tentukan sendiri.

Research & Analysis

A 240-page government report

Tugas
Exploratory Data Analysis Dashboard for Tabung Haji RCI Report
Input
One PDF, 240 pages
Hasil diminta
A website anyone can explore

Output sebenar daripada setiap model dan pelan. Masa, kos setiap run dan tahap semakan manusia hanya akan dipaparkan apabila rekodnya tersedia.

Kos sebagai filter kedua

Rujukan Pelan AI

Gunakan rujukan ini selepas anda mengenal pasti kerja dan standard output yang diperlukan. Harga menunjukkan kos langganan bulanan, bukan kos setiap run.

$5

OpenCode Go

ModelReview
DeepSeek V4 Flash (Pi)Terbaik untuk bajet
DeepSeek V4 Flash (OpenCode)Tak sebagus Pi
GLM-5.2Tak sempat siap lagi, dah habis limit
Kimi K3Tak sempat siap lagi, dah habis limit

$20

ChatGPT Plus

ModelReview
GPT-5.6 Luna Max (Codex)Terbaik untuk bajet. Hampir sama dengan Claude Opus 5 High dan GPT-5.6 Sol High
GPT-5.6 Terra High (Codex)Berfungsi dengan baik tetapi tiada apa-apa yang istimewa
GPT-5.6 Sol High (Codex)Cepat sangat habis limit

Claude Pro

ModelReview
Claude Sonnet 5 High (Claude Code)Berfungsi dengan baik tetapi tiada apa-apa yang istimewa
Claude Opus 5 High (Claude Code)Cepat sangat habis limit

$40

ChatGPT Plus + Claude Pro

ModelReview
Claude Opus 5 High + GPT-5.6 Luna MaxClaude Opus 5 High untuk merancang dan mula buat. GPT-5.6 Luna Max untuk mencantikkan page design, membuat penambahbaikan, dan menyiapkan hasil akhir. Gabungan terbaik, cuma Claude Opus 5 High tak boleh digunakan banyak sangat.

$100

ChatGPT Pro (5x)

ModelReview
GPT-5.6 Sol High (Codex)Terbaik dan berbaloi. Bagus untuk page design

Claude Max (5x)

ModelReview
Claude Opus 5 High (Claude Code)Terbaik dan berbaloi. Bagus untuk page content

$120

Claude Max (5x) + ChatGPT Plus

ModelReview
Claude Opus 5 High + GPT-5.6 Luna MaxClaude Opus 5 High untuk merancang, mula buat, dan membuat penambahbaikan. GPT-5.6 Luna Max untuk mencantikkan page design dan menyiapkan hasil akhir. Gabungan terbaik.

$200

ChatGPT Pro (20x)

ModelReview
GPT-5.6 Sol Max (Codex)Terbaik untuk semua

Claude Max (20x)

ModelReview
Claude Opus 5 Max (Claude Code)Tiada beza dengan Claude Opus 5 High

Uji dahulu sebelum bina

Ada workflow yang company anda sedang pertimbangkan untuk automate?

Kami boleh menguji beberapa approach sebelum anda melabur dalam implementation.