China
Technology

Qwen3.8 Max Melompat ke Puncak Model AI China Usai Dirilis Alibaba

Qwen3.8 Max Melompat ke Puncak Model AI China Usai Dirilis Alibaba

Qwen3.8 Max Melompat ke Puncak Model AI China Usai Dirilis Alibaba Alibaba mempercepat persaingan kecerdasan buatan global melalui peluncuran Qwen3.8 Max pada 3 Agustus 2026. Model terbaru dalam keluarga Qwen tersebut langsung mencuri perhatian setelah menempati posisi kelima dalam Text Arena dan peringkat kedua dalam Vision Arena. Capaian itu menempatkannya sebagai model buatan perusahaan China dengan posisi tertinggi dalam penilaian teks saat diumumkan.

Qwen3.8 Max bukan sekadar pembaruan kecil dari generasi sebelumnya. Alibaba membangun model ini dengan 2,4 triliun parameter, kapasitas masukan hingga satu juta token, kemampuan mengolah teks dan visual, serta rancangan yang ditujukan untuk tugas panjang. Perusahaan menempatkannya sebagai model terkuat yang pernah dirilis dalam keluarga Qwen.

Kehadiran model baru tersebut menambah ketat persaingan antara Alibaba, Moonshot AI, DeepSeek, ByteDance, MiniMax, dan pengembang China lainnya. Pada saat yang sama, Qwen3.8 Max mulai mendekati kelompok teratas yang selama ini diisi model milik Anthropic, OpenAI, Google, dan perusahaan teknologi Amerika Serikat lainnya.

Qwen3.8 Max Langsung Menempati Posisi Kelima Dunia

Peringkat awal Qwen3.8 Max menjadi bagian yang paling banyak menarik perhatian. Data Text Arena per 1 Agustus 2026 menempatkan model Alibaba pada urutan kelima dengan skor 1496. Empat posisi di atasnya ditempati Claude Fable 5 serta tiga varian Claude Opus milik Anthropic.

Dengan posisi tersebut, Qwen3.8 Max menjadi model dari perusahaan China dengan peringkat tertinggi di Text Arena. Model itu berada di atas sejumlah pesaing dari China serta beberapa produk perusahaan teknologi global.

Namun, status skornya masih ditandai sebagai preliminary atau sementara. Jumlah suara yang diterima Qwen3.8 Max juga masih lebih sedikit dibandingkan model yang telah lebih lama berada dalam Arena. Posisi tersebut dapat berubah setelah lebih banyak pengguna memberikan penilaian.

Reuters melaporkan kenaikan cepat Qwen3.8 Max dalam papan peringkat turut mendorong saham Alibaba di Hong Kong menguat sekitar 7 persen pada hari pengumuman. Reaksi tersebut menunjukkan bahwa pencapaian model AI kini tidak hanya menjadi urusan teknis, tetapi juga memengaruhi pandangan investor terhadap arah bisnis perusahaan teknologi.

Peringkat Vision Arena Bahkan Lebih Tinggi

Qwen3.8 Max memperoleh hasil lebih kuat dalam pengolahan visual. Vision Arena menempatkannya pada posisi kedua dunia dengan skor 1305. Model tersebut hanya berada di bawah Claude Fable 5 yang mencatat skor 1318.

Posisi kedua menunjukkan bahwa Qwen3.8 Max tidak hanya dirancang sebagai mesin percakapan berbasis tulisan. Model dapat menerima gambar, memahami unsur visual, membaca dokumen, menilai tampilan antarmuka, serta menggabungkan informasi visual dengan instruksi pengguna.

Alibaba menyebut kemampuan visual tersebut dapat digunakan untuk memeriksa dokumen berisi ratusan halaman, membangun kembali tampilan aplikasi dari sebuah tangkapan layar, mengubah denah dua dimensi menjadi visualisasi tiga dimensi, serta menyusun materi interaktif dari kumpulan data visual. Seluruh contoh itu berasal dari pengujian dan demonstrasi perusahaan sehingga masih perlu diuji kembali oleh pihak independen.

Capaian Vision Arena memberi Alibaba modal penting karena kebutuhan industri mulai bergerak melampaui chatbot teks. Perusahaan membutuhkan sistem yang dapat membaca laporan, foto, video, tabel, diagram, rekaman layar, dan dokumen hasil pemindaian dalam satu alur kerja.

Arena Mengandalkan Penilaian Pengguna

Peringkat Arena tidak disusun hanya melalui soal matematika atau kumpulan pertanyaan dengan jawaban tunggal. Pengguna mengirimkan perintah, lalu menerima jawaban dari dua model yang identitasnya disembunyikan. Pengguna kemudian memilih keluaran yang dianggap lebih baik.

Hasil pilihan tersebut dikumpulkan untuk membentuk skor. Penilaian mencakup berbagai permintaan terbuka, termasuk pemrograman, penulisan, matematika, analisis, penerjemahan, dan percakapan umum. Text Arena yang menjadi rujukan telah mengumpulkan lebih dari 7,5 juta suara untuk ratusan model.

Sistem semacam ini dapat menggambarkan kepuasan pengguna dalam percakapan nyata. Model yang mampu menjawab dengan jelas, mengikuti instruksi, dan menyusun penjelasan yang berguna berpeluang memperoleh pilihan lebih banyak.

Arena tetap mempunyai keterbatasan. Hasilnya dipengaruhi jenis pertanyaan yang masuk, jumlah suara, kelompok pengguna, serta cara orang menilai jawaban. Model dengan gaya penulisan menarik belum tentu menjadi sistem paling akurat untuk pekerjaan medis, hukum, atau teknik.

“Peringkat tinggi memberi alasan kuat untuk menguji Qwen3.8 Max, tetapi tidak dapat menggantikan pemeriksaan langsung pada pekerjaan yang benar benar akan dijalankan.”

Skala Model Mencapai 2,4 Triliun Parameter

Alibaba membangun Qwen3.8 Max dengan total 2,4 triliun parameter. Parameter merupakan nilai yang dipelajari model selama pelatihan untuk mengenali pola, memahami hubungan informasi, menyusun jawaban, dan menentukan tindakan berikutnya.

Jumlah tersebut membuat Qwen3.8 Max menjadi model terbesar yang pernah diumumkan Alibaba. Skalanya mendekati Kimi K3 milik Moonshot AI yang memiliki sekitar 2,8 triliun parameter.

Meski demikian, jumlah parameter tidak selalu berbanding lurus dengan kualitas. Data pelatihan, rancangan model, metode penyelarasan, kemampuan menggunakan alat, serta proses pengujian tetap menentukan hasil akhirnya.

Model dengan parameter lebih sedikit dapat mengungguli model yang lebih besar pada tugas tertentu. Jumlah parameter lebih tepat dibaca sebagai gambaran skala sistem, bukan jaminan bahwa model tersebut selalu lebih pintar atau lebih akurat.

Ukuran besar juga membawa persoalan biaya. Seluruh parameter memerlukan ruang penyimpanan dan infrastruktur komputasi. Alibaba kemudian memakai rancangan Sparse Mixture of Experts agar tidak semua bagian model harus bekerja dalam setiap permintaan.

Hanya 95 Miliar Parameter Diaktifkan Sekaligus

Walaupun menyimpan 2,4 triliun parameter, Qwen3.8 Max hanya mengaktifkan sekitar 95 miliar parameter pada satu proses. Sistem memilih bagian yang dinilai paling sesuai dengan permintaan pengguna.

Cara kerja ini dapat dibandingkan dengan sebuah organisasi yang mempunyai banyak tim ahli. Ketika menerima persoalan pemrograman, sistem mengarahkan pekerjaan kepada kelompok parameter yang lebih berkaitan dengan kode. Untuk pemeriksaan gambar atau dokumen, bagian lain dapat memperoleh peran lebih besar.

Rancangan tersebut membantu mengurangi jumlah komputasi dibandingkan apabila seluruh 2,4 triliun parameter dijalankan bersamaan. Alibaba menyatakan pemilihan parameter aktif dapat menekan waktu respons dan kebutuhan pemrosesan.

Efisiensi tetap perlu dinilai melalui penggunaan nyata. Pengembang perlu melihat kecepatan keluaran, biaya setiap permintaan, kestabilan layanan, serta kemampuan model mempertahankan kualitas dalam tugas panjang.

Alibaba juga menggabungkan Mixture of Experts dengan mekanisme perhatian hibrida. Sistem perhatian membantu model menentukan bagian masukan yang perlu diberi bobot lebih besar ketika membentuk jawaban atau menjalankan tindakan.

Kapasitas Satu Juta Token Membuka Tugas Berukuran Besar

Qwen3.8 Max mampu menerima masukan hingga satu juta token. Token merupakan potongan informasi yang dapat berupa bagian kata, kata pendek, angka, tanda, atau elemen data lainnya.

Kapasitas tersebut memungkinkan pengguna memberikan kumpulan dokumen yang sangat panjang dalam satu sesi. Model dapat dipakai untuk membaca kontrak, laporan perusahaan, repositori kode, transkrip, dan kumpulan catatan tanpa harus selalu memecahnya menjadi bagian kecil.

Alibaba bahkan mengklaim model dapat mengolah serial televisi lengkap atau rekaman siaran hingga 100 jam, kemudian menyusunnya menjadi basis pengetahuan yang dapat ditelusuri. Klaim itu menunjukkan arah penggunaan Qwen3.8 Max sebagai pekerja digital yang menangani bahan dalam jumlah besar.

Kapasitas panjang tidak otomatis berarti setiap detail akan dipahami dengan ketelitian yang sama. Model dapat kehilangan hubungan antara informasi yang letaknya berjauhan, mencampur nama, atau melewatkan ketentuan kecil.

Perusahaan yang hendak menggunakannya untuk dokumen penting tetap perlu menyusun metode pemeriksaan. Hasil model sebaiknya dilengkapi rujukan halaman, kutipan dokumen, dan verifikasi manusia agar kesalahan dapat ditemukan.

Pemrograman Menjadi Salah Satu Kekuatan Utama

Selain berada di posisi tinggi dalam penilaian teks dan visual, Qwen3.8 Max menempati peringkat keempat dalam Frontend Code Arena ketika diumumkan. Alibaba menggunakan capaian tersebut untuk menonjolkan kemampuan pemrograman serta pengoperasian agen AI.

Dalam pengujian internal, model diminta membangun sebuah kerangka agen bernama oh my cli. Qwen3.8 Max disebut bekerja secara mandiri selama 16 hari dengan menjalankan rangkaian pembuatan kode, pengujian, pemeriksaan catatan kesalahan, serta perbaikan berulang. Hasil proyek kemudian dibuka melalui GitHub.

Pengujian tersebut tidak hanya mengukur kemampuan menulis satu fungsi. Model harus mempertahankan tujuan, mengingat perubahan sebelumnya, memeriksa hasil pengujian, dan mengambil keputusan untuk pekerjaan berikutnya.

Kemampuan bekerja dalam waktu panjang menjadi medan persaingan baru. Perusahaan AI ingin membangun model yang tidak berhenti setelah memberikan satu jawaban, tetapi dapat menyusun rencana, menggunakan alat, membaca hasil, memperbaiki kesalahan, dan melanjutkan pekerjaan.

Alibaba Menguji Model dalam Perancangan Chip

Salah satu demonstrasi teknis yang dipublikasikan Alibaba berkaitan dengan perancangan akselerator perangkat keras kriptografi. Qwen3.8 Max diberi lingkungan simulasi, sintesis, dan tata letak fisik untuk mengoptimalkan rancangan sirkuit.

Model menjalankan sekitar 500 putaran dan 71 evaluasi. Rancangan awal yang layak berfungsi mempunyai ukuran 8.298 gerbang, kemudian ditekan menjadi 678 gerbang setelah berbagai perubahan algoritma dan susunan modul.

Alibaba menyatakan model melakukan penyuntingan kode RTL, memperbaiki kesalahan simulasi, mencari bagian yang berlebihan, menggabungkan modul, dan mengubah susunan jalur data tanpa campur tangan manusia selama proses utama.

Hasil ini memperlihatkan kemampuan yang menarik, tetapi berasal dari lingkungan pengujian yang dibuat oleh pengembang model. Kinerja pada proyek perangkat keras industri dapat berbeda karena batas keamanan, aturan manufaktur, ukuran desain, dan kebutuhan verifikasi jauh lebih rumit.

Model juga tidak dapat dianggap sebagai pengganti insinyur. Keluaran AI tetap harus melewati pemeriksaan fungsi, keselamatan, efisiensi daya, kelayakan produksi, dan kepatuhan terhadap standar teknis.

Tugas Profesional Ikut Menjadi Sasaran

Alibaba menguji Qwen3.8 Max pada berbagai pekerjaan bernilai ekonomi tinggi. Contohnya mencakup pemeriksaan dokumen hukum, pembuatan purwarupa aplikasi perbankan, penyusunan menu restoran, analisis olahraga, visualisasi rehabilitasi, dan perancangan struktur bangunan.

Dalam salah satu contoh, perusahaan menyebut model menemukan 1.284 klausul yang dianggap relevan dari ratusan dokumen dalam waktu kurang dari satu jam. Pada contoh lain, model menyusun delapan layar purwarupa aplikasi perbankan dengan sistem desain yang seragam.

Seluruh contoh itu merupakan klaim Alibaba dan belum menjadi bukti bahwa model dapat langsung diberi tanggung jawab profesional. Dokumen hukum dapat mempunyai ketentuan yang hanya dapat dinilai berdasarkan yurisdiksi tertentu. Rancangan struktur membutuhkan pemeriksaan insinyur berlisensi, sedangkan saran rehabilitasi harus berada di bawah tenaga kesehatan.

“Kemampuan menyelesaikan pekerjaan dengan cepat baru bernilai ketika hasilnya dapat diperiksa, dilacak, dan dipertanggungjawabkan oleh manusia yang memahami bidang tersebut.”

Qwen3.8 Max Sudah Bisa Diakses Melalui API

Alibaba menyatakan Qwen3.8 Max telah tersedia bagi pengembang global melalui API di Alibaba Cloud Model Studio. Model juga dapat dicoba melalui QwenWork, platform agen kerja terpadu yang disiapkan Alibaba.

Akses API memungkinkan perusahaan menghubungkan model dengan aplikasi, basis data, layanan pelanggan, perangkat pemrograman, serta sistem kerja internal. Pengguna tidak perlu memasang seluruh model pada pusat data sendiri.

Hal tersebut penting karena ukuran 2,4 triliun parameter memerlukan ruang penyimpanan dan perangkat keras dalam jumlah sangat besar. Bahkan dengan hanya 95 miliar parameter aktif, penyediaan sistem secara mandiri tetap berada di luar kemampuan sebagian besar perusahaan kecil.

Alibaba menggunakan Qwen3.8 Max sebagai bagian dari bisnis komputasi awannya. Model unggulan dapat menarik pengembang memakai penyimpanan data, komputasi, pemantauan, keamanan, dan layanan tambahan milik Alibaba Cloud.

Bobot Model Dijadwalkan Menyusul

Pada saat pengumuman 3 Agustus 2026, Alibaba menyatakan bobot Qwen3.8 Max dijadwalkan dirilis pada pekan berikutnya. Artinya, pada hari peluncuran, model baru tersedia melalui layanan Alibaba dan bobotnya belum dapat diunduh secara umum.

Bobot terbuka memberi kesempatan kepada pengembang untuk menjalankan, memeriksa, atau menyesuaikan model pada infrastruktur sendiri. Pendekatan ini menjadi salah satu strategi perusahaan AI China dalam memperluas penggunaan produknya ke berbagai negara.

Namun, pembukaan bobot tidak selalu berarti seluruh proses pelatihan ikut dibuka. Data pelatihan, kode pelatihan, metode penyaringan, biaya komputasi, dan susunan lengkap perangkat keras dapat tetap menjadi rahasia perusahaan.

Ketentuan lisensi juga menentukan batas penggunaan. Pengembang perlu memeriksa apakah model boleh digunakan untuk layanan komersial, penelitian, penyesuaian, dan distribusi ulang.

Persaingan AI China Bergerak Sangat Cepat

Peluncuran Qwen3.8 Max terjadi ketika perusahaan China berlomba membangun model berukuran besar dengan biaya penggunaan yang lebih rendah. Moonshot AI lebih dahulu memperkenalkan Kimi K3 dengan 2,8 triliun parameter, sedangkan DeepSeek merilis V4 Flash dengan perhatian besar pada harga pemrosesan.

Reuters mencatat perusahaan China melihat peluang pada kebutuhan bisnis yang tidak selalu memerlukan model termahal. Banyak perusahaan mencari sistem yang cukup kuat, mudah disesuaikan, transparan, dan dapat diakses dengan biaya terkendali.

Strategi bobot terbuka dapat memperluas pemakaian model China di kalangan pengembang global. Perusahaan dapat menyesuaikan model untuk bahasa, bidang usaha, dan data internal tanpa sepenuhnya bergantung pada penyedia layanan tertutup.

Alibaba memiliki keuntungan berupa jaringan komputasi awan, perdagangan elektronik, logistik, layanan perusahaan, dan basis pelanggan yang luas. Qwen dapat diuji dan diterapkan pada berbagai layanan di dalam kelompok usahanya.

Posisi Puncak China Masih Bisa Bergeser

Peringkat Qwen3.8 Max di Arena masih bersifat awal. Text Arena mencatat sekitar 3.327 suara untuk model tersebut, jauh lebih sedikit dibandingkan sejumlah model Anthropic yang telah memperoleh puluhan ribu suara. Vision Arena mencatat lebih dari 5.000 suara untuk Qwen3.8 Max.

Selisih skor dengan beberapa model di sekitarnya juga relatif kecil. Penambahan suara dapat mengubah urutan, terutama ketika rentang ketidakpastian skor masih lebar.

Model pesaing juga terus diperbarui. Moonshot AI, DeepSeek, ByteDance, MiniMax, Zhipu AI, dan perusahaan lain dapat meluncurkan sistem baru dalam waktu singkat.

Karena itu, posisi sebagai model AI China dengan peringkat tertinggi perlu selalu disertai waktu pengukuran. Berdasarkan data Arena pada awal Agustus 2026, Qwen3.8 Max memang memimpin kelompok model China untuk tugas teks dan berada pada posisi kedua dunia dalam pengolahan visual.

Ujian yang lebih berat akan datang ketika bobot tersedia, pengembang mulai menjalankan model di luar sistem Alibaba, dan perusahaan mengujinya menggunakan dokumen, bahasa, kode, serta alur kerja yang tidak disiapkan oleh pembuatnya. Pada tahap tersebut, perhatian akan beralih dari besarnya parameter menuju ketepatan jawaban, biaya operasi, keamanan data, kestabilan, dan kemampuan model mengakui ketika informasi yang dimilikinya tidak cukup.

Bagikan:

Leave a Reply

Your email address will not be published. Required fields are marked *