Diyetekno.com- Persaingan di ranah kecerdasan buatan (AI) semakin memanas dengan diluncurkannya model-model AI unggulan terbaru dari OpenAI dan Anthropic. Bulan ini, dunia teknologi dihebohkan dengan kehadiran ChatGPT-6 dan Claude Opus 5.5, dua platform yang digadang-gadang memiliki kemampuan luar biasa, jauh melampaui ekspektasi pengguna pada umumnya. Namun, seberapa jauh kemampuan mereka dalam skenario penggunaan sehari-hari? Sebuah pengujian mendalam baru-baru ini mengungkap hasilnya yang mengejutkan.
OpenAI memperkenalkan keluarga GPT-6 yang dibangun di atas fondasi GPT-6 Astra, model paling impresif mereka sejauh ini. Peningkatan signifikan terlihat pada kemampuan penalaran, pekerjaan profesional, pengkodean, penjelajahan web, dan penggunaan komputer. Versi terbarunya, GPT-6 Sol, membawa kecerdasan tersebut ke dalam model yang dirancang untuk pekerjaan sehari-hari, diposisikan sebagai model penalaran yang lebih cepat dan terjangkau.

Di sisi lain, Claude Opus 5.5 dari Anthropic mengambil pendekatan yang sedikit berbeda. Anthropic menggambarkannya sebagai model yang dibangun untuk pekerjaan agen dan pengetahuan jangka panjang, dengan pemikiran adaptif yang menentukan seberapa besar upaya yang dibutuhkan untuk suatu permintaan. Model ini memiliki jendela konteks 1 juta token, mampu menghasilkan hingga 128.000 token output, dan menurut Anthropic, mencapai kinerja yang hampir sama dengan Claude Fable 5.1 yang lebih tinggi pada sebagian besar tugas, namun dengan biaya operasional 40% lebih rendah dari Opus sebelumnya. Anthropic juga secara khusus menyoroti peningkatan dalam cara model berkomunikasi secara alami dan mengikuti instruksi penulisan.
Perbedaan-perbedaan ini terdengar mengesankan di atas kertas, tetapi tidak serta-merta menunjukkan chatbot mana yang lebih unggul dalam membantu pengguna di kehidupan nyata. Untuk menjawab pertanyaan ini, lima perintah umum diberikan kepada ChatGPT-6 dan Claude Opus 5.5 secara bersamaan. Hasilnya ternyata tidak sepihak seperti yang mungkin diharapkan banyak pihak.
1. Perencanaan Dunia Nyata: Pesta Ulang Tahun Anak
Dalam skenario perencanaan pesta ulang tahun untuk 10 anak usia 8-11 tahun dengan anggaran terbatas Rp 1.500.000 (setara $150), durasi tiga jam, opsi dalam ruangan jika hujan, termasuk makanan, minimalisasi waktu layar, serta mempertimbangkan dua anak vegetarian dan satu alergi kacang, kedua AI diuji. ChatGPT menawarkan kerangka konseptual yang jelas, termasuk identitas acara dan arah. Pendekatan penganggaran Rp 360.000 untuk tiga pizza keju siap antar dinilai lebih praktis bagi orang tua. Namun, Claude menunjukkan kecerdasan proaktif dalam menangani alergi dan protokol diet, bahkan mempertimbangkan kontaminasi silang pada kue. Claude juga melakukan penganggaran ganda dengan mengalokasikan Rp 140.000 untuk tas jinjing kanvas dan Rp 120.000 untuk spidol kain, yang berfungsi sebagai aktivitas kerajinan saat kedatangan sekaligus suvenir pesta, menghemat biaya dan mengurangi penggunaan plastik murah. Claude juga memberikan jadwal terperinci dan solusi operasional. Claude keluar sebagai pemenang karena menyajikan rencana siap pakai yang komprehensif dengan kehati-hatian keamanan yang asli, sementara ChatGPT lebih condong pada daftar belanja yang terfragmentasi.
2. Penulisan: Membuat AI Terdengar Manusiawi
Tantangan berikutnya adalah menulis ulang pengumuman membosankan menjadi sesuatu yang ingin dibaca orang sungguhan, dengan tetap mempertahankan semua detail faktual, menghindari tanda hubung, klise, dan kata-kata seperti "menarik," "revolusioner," "mengubah permainan," atau "lancar." ChatGPT menawarkan kalimat pembuka yang menarik pembaca dan menghindari gaya AI sambil mempertahankan setiap detail faktual. Claude, di sisi lain, membingkai ulang poin-poin penting menjadi manfaat konkret bagi manusia dan merangkai detail seputar solusi nyata di tempat kerja. Claude memenangkan putaran ini karena memahami bahwa penulisan ulang "manusiawi" memerlukan pemikiran ulang tentang cara menjelaskan nilai fitur, bukan hanya mengubah beberapa kata kerja.
3. Penalaran: Pilihan Sewa Liburan yang Tidak Jelas
Sebuah keluarga harus memilih antara dua properti sewaan liburan. Sewa A seharga Rp 18.500.000 ($1.850) dan berjarak 10 menit jalan kaki dari pantai. Sewa B seharga Rp 15.000.000 ($1.500) tetapi memerlukan 25 menit berkendara ke pantai dan biaya parkir Rp 350.000 ($35) per hari. Mereka menginap tujuh hari dan berharap mengunjungi pantai dua kali sehari dengan tiga anak. ChatGPT memberikan perspektif terbaik tentang usia anak-anak dan dengan cerdik menunjukkan bahwa "10 menit jalan kaki" sangat bervariasi tergantung infrastruktur. Namun, Claude melakukan perhitungan jarak tempuh, membuktikan bahwa penghematan finansial Sewa B hanya sekitar Rp 550.000-Rp 650.000 ($55-$65) untuk seluruh minggu. Claude juga membuat poin psikologis yang cerdas: memuat/membongkar tiga anak ke kursi mobil empat kali sehari kemungkinan besar akan membuat keluarga membatalkan perjalanan pantai kedua. Claude juga dengan tepat menandai rahasia kotor platform sewa liburan: tarif dasar tidak mencerminkan biaya kebersihan, biaya layanan, atau pajak hunian, yang dapat dengan mudah membalik perbedaan Rp 1.050.000 ($105). Claude memenangkan putaran ini dengan tipis, berkat analisis finansial yang menyeluruh dan antisipasi biaya tersembunyi.
4. Pilihan Berlimpah: Anggaran Kota
Sebuah kota memiliki Rp 100 miliar ($10 juta) untuk dibelanjakan pada tiga opsi: membangun perpustakaan umum baru, memberikan pembayaran satu kali Rp 500.000 ($50) kepada setiap rumah tangga, atau meningkatkan infrastruktur air yang menua. ChatGPT mengikuti semua instruksi dengan rapi dan memberikan pembelaan yang mudah dibaca untuk opsi C (infrastruktur air). Claude membingkai pilihannya melalui insentif kota dan menyadari bahwa mendanai apa yang diabaikan politik elektoral adalah fungsi inti manajemen kota. Claude memenangkan putaran ini karena memberikan jawaban yang jauh lebih baik, seolah memiliki pengalaman dalam administrasi keuangan publik.
5. Uji Pamungkas: Permintaan yang Tidak Jelas dan Inisiatif
Permintaan terakhir adalah membangun sistem yang realistis untuk mengatasi kehidupan yang tidak terorganisir bagi orang tua dengan tiga anak, pekerjaan penuh waktu, dan tanggung jawab rumah tangga, dengan hanya 30 menit setiap malam untuk membereskan semuanya. ChatGPT menawarkan cara sederhana untuk mencegah kelelahan dan menyertakan instruksi yang dipecah menjadi langkah-langkah. Claude membahas beban mental, sebuah wawasan yang tajam dan akurat tentang mengapa disorganisasi terjadi, dan juga menyebutkan tip yang berguna untuk mendelegasikan tugas jika memungkinkan. Namun, ChatGPT memenangkan putaran ini karena kerangka kerja kognitifnya lebih melindungi kapasitas mental orang tua yang kelelahan.
Pemenang Keseluruhan: Claude Opus 5.5
Setelah lima pengujian, Claude Opus 5.5 unggul dalam empat di antaranya. Yang mengejutkan adalah bagaimana perbedaan yang sama secara konsisten muncul di antara kedua model ini pada tugas-tugas yang sama sekali tidak terkait. Claude cenderung terus menggali lebih dalam. Ketika diminta merencanakan pesta ulang tahun, ia memikirkan kontaminasi silang dan menemukan cara agar satu pembelian dapat melayani dua tujuan. Ketika diberikan masalah sewa liburan, ia menghitung biaya yang tidak secara eksplisit diminta dan mempertimbangkan apakah ketidaknyamanan berkendara benar-benar akan mengubah perilaku keluarga. Bahkan ketika memilih bagaimana sebuah kota harus membelanjakan Rp 100 miliar, ia melihat melampaui pro dan kontra yang jelas untuk memikirkan mengapa pemerintah membuat keputusan ini.
Di situlah Opus 5.5 terasa paling kuat. ChatGPT-6 umumnya lebih ramping, yang sangat sesuai dengan citra ChatGPT. Terlepas dari modelnya, ChatGPT selalu tampak menjadi model yang kurang "bertele-tele" di antara keduanya, dengan respons yang langsung pada intinya. Namun, pendekatan itu menjadi keuntungan dalam pengujian terakhir, di mana kesederhanaan dan fokus pada pencegahan kelelahan menjadi kunci. Kedua AI ini menunjukkan kemampuan luar biasa, namun dengan pendekatan dan kekuatan yang berbeda dalam menghadapi tantangan dunia nyata.

