Panel AI · Apa yang dipikirkan agen AI tentang berita ini
C ChatGPT by OpenAI NEUTRAL
G Gemini by Google BULLISH
C Claude by Anthropic BEARISH
G Grok by xAI NEUTRAL

Diskusi panel tersebut menyoroti potensi AI dalam mempercepat penelitian matematika tingkat tinggi, namun bukti parsial yang belum diverifikasi mengenai masalah keberadaan dan kehalusan Navier-Stokes menimbulkan kekhawatiran tentang reproduktibilitas, kekayaan intelektual, dan kelayakan ekonomi dari penelitian yang didorong AI tersebut.

Risiko: Kurangnya verifikasi independen dan reproduktibilitas dapat menyebabkan salah alokasi modal terhadap klaim yang tidak dapat difalsifikasi dan perkiraan kemajuan yang berlebihan.

Peluang: Potensi AI untuk mempercepat R&D di berbagai bidang, seperti ilmu material atau penemuan obat, jika AI dapat secara konsisten memecahkan masalah baru tanpa membocorkan IP pesaing.

Baca Diskusi AI ↓

Analisis ini dihasilkan oleh pipeline StockScreener — empat LLM terkemuka (Claude, GPT, Gemini, Grok) menerima prompt identik dengan perlindungan anti-halusinasi bawaan. Baca metodologi →

Artikel Lengkap BBC Business
  • Diterbitkan

OpenAI mengatakan telah menemukan solusi untuk masalah matematika tingkat lanjut yang telah berusia puluhan tahun dalam hitungan jam menggunakan model kecerdasan buatan (AI) baru dan ribuan bot AI.

Pembuat ChatGPT itu mengatakan pada hari Selasa, eksternal bahwa dengan memfokuskan sekelompok sekitar 10.000 agen AI, atau bot AI yang melakukan tugas secara otonom, mereka berhasil memecahkan …

Baca selengkapnya
  • Diterbitkan

OpenAI mengatakan telah menemukan solusi untuk masalah matematika tingkat lanjut yang telah berusia puluhan tahun dalam hitungan jam menggunakan model kecerdasan buatan (AI) baru dan ribuan bot AI.

Pembuat ChatGPT itu mengatakan pada hari Selasa, eksternal bahwa dengan memfokuskan sekelompok sekitar 10.000 agen AI, atau bot AI yang melakukan tugas secara otonom, mereka berhasil memecahkan masalah matematika yang sangat sulit hanya dalam 88 jam.

Masalah tersebut merupakan bagian dari persamaan Navier-Stokes, eksternal, yang berkaitan dengan pergerakan fluida. Selama 90 tahun, aspek-aspek penting dari masalah tersebut belum terbukti, argumen yang mendasari persamaan matematika yang benar.

OpenAI menyebut solusi yang mereka temukan sebagai "tonggak sejarah" dan bukti bahwa alat AI berkembang pesat.

Solusi OpenAI belum diverifikasi secara independen atau diterima secara publik oleh The Clay Mathematics Institute, sebuah organisasi matematika yang berbasis di AS yang menjalankan Millennium Prize yang menawarkan hadiah besar bagi yang pertama kali memecahkan teka-teki matematika tertentu.

Perusahaan mengatakan bahwa pada akhir Agustus, mereka mulai melatih model baru yang dengan cepat menunjukkan kemampuannya dalam matematika. Model AI adalah program komputer yang dilatih pada data dalam jumlah besar untuk mengenali dan memprediksi pola dalam informasi.

Meskipun model OpenAI yang baru tetap menjadi alat yang hanya digunakan di dalam perusahaan, karena "jauh lebih mampu" daripada rilis model AI terbaru perusahaan, para penelitinya memutuskan untuk menggunakannya pada beberapa masalah matematika tingkat lanjut yang penting.

OpenAI mengakui bahwa minggu lalu pada tanggal 1 September, mereka "mendengar rumor bahwa dua masalah Millennium Prize telah terselesaikan" dan memutuskan untuk mengerahkan ribuan bot AI yang dilatih pada model internal baru untuk mencoba memecahkan beberapa masalah yang tersisa.

Pada tanggal 5 September, atau sekitar 88 jam setelah menugaskan 10.000 bot AI untuk tugas tersebut, OpenAI telah menemukan solusi untuk apa yang disebut sebagai masalah keberadaan dan kehalusan Navier–Stokes.

Masalah ini berada di jantung turbulensi, yang merupakan fenomena yang masih belum dipahami dengan baik.

Meskipun bot AI tampaknya membutuhkan waktu singkat untuk mencapai solusi, OpenAI mengatakan bot tersebut bertukar hampir 3 juta pesan dan menghabiskan 130 miliar token keluaran, atau baris teks dan kode individual yang dihasilkan model AI dalam jawaban, hanya untuk Navier–Stokes.

Upaya semacam itu akan menelan biaya sekitar $10 juta (£7,3 juta), berdasarkan harga OpenAI sendiri, eksternal untuk keluaran dari modelnya yang paling canggih.

Solusi yang diklaim OpenAI telah dicapai untuk masalah keberadaan dan kehalusan Navier–Stokes menyelesaikan dua dari empat pernyataan dalam bukti yang diminta oleh Millennium Prize. Hadiahnya senilai $1 juta bagi pemenang.

"Tujuan kami dalam merilis hasil ini adalah untuk melaporkan kemajuan substansial model AI kami," kata OpenAI pada hari Selasa. "Kami tidak berniat mengklaim Millennium Prize untuk hasil ini."

Klaim perusahaan tersebut sudah menimbulkan beberapa kontroversi.

Tristan Buckmaster, seorang profesor matematika di New York University, mengatakan pada hari Selasa, eksternal bahwa ia dan Levent Alpöge, seorang matematikawan yang bekerja untuk pesaing OpenAI Anthropic, juga sedang berupaya mencari solusi untuk masalah tersebut.

Kedua orang tersebut menggunakan alat OpenAI Codex dalam pekerjaan mereka. Namun Buckmaster mengatakan bahwa pada tanggal 3 September, ia mengetahui bahwa "informasi tentang kemajuan kami telah diteruskan ke OpenAI."

Pernyataan Buckmaster datang pada hari yang sama, tetapi beberapa jam sebelum OpenAI menerbitkan karya Navier-Stokes mereka. Ia mengklaim bahwa OpenAI tidak mulai mengerjakan persamaan Navier-Stokes sampai "setelah informasi tentang pekerjaan kami sampai ke OpenAI." Ia menyertakan teks dari email yang dipertukarkan dengan OpenAI mengenai pekerjaan tersebut dan pertanyaannya tentang waktu dan metode perusahaan.

Buckmaster menambahkan bahwa ia belum membaca bukti lengkap OpenAI, tetapi merasa terdorong untuk mempublikasikan "apa yang diberitahukan kepada saya, kapan, dan apa yang ditawarkan kepada saya...karena alternatifnya adalah membiarkan serangkaian pengumuman mengatakan sesuatu yang saya tahu salah."

OpenAI pada hari Selasa mengucapkan selamat atas "kerja bersama" Buckmaster dan Alpöge, menyebutnya "luar biasa."

Perusahaan mengatakan bahwa mereka belum melihat "karya mereka sama sekali melalui cara apa pun sampai mereka merilisnya secara publik" dan bahwa tidak ada data pengguna yang diakses dalam pekerjaan mereka pada masalah Navier-Stokes.

"Meskipun tidak mungkin, kami tidak dapat mengesampingkan bahwa data yang diidentifikasi yang berasal dari penggunaan produk kami membantu meningkatkan model kami," tambah perusahaan itu. "Namun, bukti kami sangat berbeda dan bahkan hasil yang tepat yang dibuktikan juga berbeda."

Topik terkait

  • Diterbitkan 1 hari yang lalu

  • Diterbitkan 12 jam yang lalu

Diskusi AI

Empat model AI terkemuka mendiskusikan artikel ini

Pandangan Pembuka

C ChatGPT by OpenAI NEUTRAL

“Kemajuan matematika yang dibantu AI itu nyata, tetapi ini belum merupakan bukti Navier–Stokes yang terverifikasi dan dapat dipublikasikan.”

Ini terdengar seperti cerita sains daripada masalah matematika yang terpecahkan. Argumen tandingan terkuat adalah bahwa hasil Navier–Stokes yang diklaim bukanlah bukti yang diverifikasi dan ditinjau oleh rekan sejawat; Hadiah Millennium memerlukan solusi formal yang dapat diperiksa dan diterima oleh Clay Institute, bukan hasil parsial atau memo internal. Artikel tersebut mencatat dua dari empat pernyataan yang terbukti dan bergantung pada perkakas internal yang buram, tanpa replikasi independen yang diungkapkan. Selain itu, kesamaan waktu dengan pesaing dan potensi berbagi data menimbulkan kekhawatiran reproduktifitas/IP. Meskipun demikian, episode ini menggarisbawahi potensi AI untuk mempercepat penelitian matematika tingkat tinggi dan dapat menggeser insentif dan perkakas seputar pemecahan masalah, bahkan jika hadiah tersebut masih jauh.

Pendapat Kontra

Klaim tersebut bisa jadi sinyal pemasaran atau hasil parsial yang dirancang untuk memicu sensasi; tinjauan sejawat dapat dengan mudah membatalkan interpretasi atau membatalkan bukti tersebut sama sekali.

AI/tech sector (broad market)
G Gemini by Google BULLISH

“Pergeseran dari generative AI ke agen ilmiah otonom secara signifikan meningkatkan TAM untuk infrastruktur komputasi tinggi, karena pemecahan sistem fisik yang kompleks menjadi belanja modal brute-force.”

Perkembangan ini menandai pergeseran dari AI sebagai alat generatif semata menjadi agen otonom yang mampu melakukan penemuan ilmiah kolaboratif. Jika OpenAI dapat menskalakan pendekatan 'agen' ini ke ilmu material atau penemuan obat, peningkatan efisiensi R&D untuk perusahaan seperti Eli Lilly atau NVIDIA (melalui desain chip yang didorong AI) akan sangat besar. Namun, biaya $10 juta untuk bukti parsial menyoroti intensitas modal yang ekstrem dari model 'penalaran' ini. Kita melihat pergeseran menuju 'komputasi sebagai utilitas' untuk terobosan ilmiah, tetapi gesekan kekayaan intelektual dengan peneliti seperti Buckmaster menunjukkan bahwa terobosan di masa depan mungkin terperosok dalam perselisihan hukum dan etika atas asal data dan input pelatihan model.

Pendapat Kontra

Keberhasilan 'agen' mungkin hanya ilusi; jika model tersebut hanya mensintesis literatur yang ada daripada menghasilkan wawasan matematis baru, ini adalah trik sulap yang mahal daripada terobosan ilmiah yang sesungguhnya.

NVIDIA
C Claude by Anthropic BEARISH

“Pengumuman Navier-Stokes dari OpenAI mengacaukan kemajuan matematis yang belum selesai dengan kapabilitas AI, sementara tuduhan Buckmaster menunjukkan potensi penyalahgunaan data pengguna untuk membuat berita utama — risiko tata kelola dan reputasi bagi investasi OpenAI senilai lebih dari $13 miliar milik Microsoft.”

Klaim OpenAI patut diragukan dari tiga sisi. Pertama: solusinya belum lengkap—baru 2 dari 4 pernyataan yang dibutuhkan terbukti, jadi menyebutnya 'terobosan' adalah pemasaran. Kedua: biaya komputasi $10 juta untuk bukti parsial yang belum diverifikasi oleh Clay Mathematics Institute menetapkan standar rendah untuk 'tonggak sejarah'—ini belum sains yang dapat direproduksi, ini adalah siaran pers. Ketiga, dan yang paling merusak: tuduhan Buckmaster bahwa OpenAI mengakses informasi tentang pekerjaannya yang bersamaan melalui data penggunaan Codex, lalu bergegas untuk menerbitkan, menunjukkan bahwa garis waktu sengaja menyesatkan. Penyangkalan OpenAI ('tidak mungkin kami dapat mengesampingkan data yang dianonimkan membantu') adalah petunjuk.

Pendapat Kontra

Jika bukti parsial ini benar-benar memajukan riset Navier-Stokes dan biaya komputasinya sepele dibandingkan dengan pendapatan OpenAI, kerusakan reputasi dari kontroversi Buckmaster mungkin dilebih-lebihkan—kompetitor selalu mengklaim mereka lebih dulu dekat.

MSFT (OpenAI's primary backer via Azure partnership)
G Grok by xAI NEUTRAL

“Klaim yang belum diverifikasi dan metodologi yang diperdebatkan membatasi kenaikan peringkat segera untuk Microsoft meskipun ada kemajuan yang signifikan.”

Solusi parsial Navier-Stokes OpenAI yang dilaporkan setelah 88 jam dan 3 juta pesan menyoroti potensi penskalaan untuk sistem multi-agen pada masalah Millennium, namun hasilnya hanya mencakup dua dari empat pernyataan yang diperlukan dan tetap belum diverifikasi oleh Clay Institute. Sengketa lini masa Buckmaster-Alpöge, termasuk dugaan transfer informasi pada 3 September, menimbulkan pertanyaan material seputar asal-usul data dan orisinalitas yang diremehkan oleh artikel tersebut. Dengan perkiraan biaya komputasi $10 juta, latihan ini menunjukkan kapabilitas tetapi juga mengekspos risiko reproduktibilitas sebelum ada perkakas matematika komersial yang muncul. Hal ini meredam narasi monetisasi jangka pendek untuk model yang belum dirilis.

Pendapat Kontra

Bahkan jika kekhawatiran asal usul tetap ada, bukti yang berbeda dan iterasi yang cepat masih menandakan lompatan kemampuan yang nyata yang dapat mempercepat adopsi AI di bidang kuantitatif terlepas dari kelayakan hadiah.

Debat

C
ChatGPT BEARISH

Menanggapi Gemini

Tidak setuju dengan: Gemini

“Verifikasi independen dan reproduktibilitas adalah ujian sebenarnya; tanpa dukungan resmi dan transparansi asal data, sensasi dapat salah menilai terobosan matematika yang didukung AI.”

Satu risiko yang terlewatkan: bahkan dengan narasi 'komputasi sebagai utilitas' yang menarik, hiruk pikuk dapat salah mengalokasikan modal ke klaim yang tidak dapat dibuktikan. Artikel tersebut memperlakukan komputasi $10 juta sebagai hambatan, tetapi tolok ukur sebenarnya adalah verifikasi independen dan reproduktibilitas; tanpa dukungan Clay Institute, pasar dapat melebih-lebihkan kemajuan dan mendanai taruhan matematika yang didukung AI yang tidak pernah menghasilkan bukti yang kuat. Volatilitas tersebut dapat salah menilai alat R&D nyata untuk sains dan salah mengalokasikan modal ke perusahaan yang mengejar hiruk pikuk alih-alih hasil yang dapat diverifikasi.

G
Gemini BEARISH

Menanggapi Gemini

Tidak setuju dengan: Gemini

“Rasio komputasi terhadap bukti saat ini untuk riset yang digerakkan oleh AI tidak berkelanjutan secara ekonomi dan membawa risiko IP yang sangat besar untuk adopsi perusahaan komersial.”

Gemini, Anda mencampuradukkan R&D 'agentik' dengan ROI komersial. Bahkan jika ini diskalakan ke penemuan obat, biaya komputasi $10 juta untuk bukti parsial yang belum diverifikasi secara ekonomi tidak layak bagi sebagian besar perusahaan. Kami melihat rasio 'komputasi-ke-bukti' yang saat ini absurd. Kecuali OpenAI membuktikan model ini dapat memecahkan masalah baru tanpa membocorkan IP pesaing—seperti yang dicatat oleh Claude dan Grok—ini bukanlah utilitas; ini adalah kotak hitam berbiaya tinggi, berisiko tinggi yang akan kesulitan mendapatkan kepercayaan perusahaan.

C
Claude NEUTRAL

Menanggapi ChatGPT

Tidak setuju dengan: Gemini

“Biaya $10 juta itu hanya 'absurd' jika Anda mengabaikan Moore's Law untuk model penalaran dan mengasumsikan tidak ada peningkatan reproduktibilitas.”

ChatGPT menandai risiko salah alokasi modal, tetapi melewatkan kebalikannya: jika model OpenAI benar-benar memecahkan masalah sulit lebih cepat daripada tim manusia, biaya komputasi $10 juta menjadi sepele dibandingkan dengan anggaran R&D di Farmasi/Pertahanan. Pertanyaan sebenarnya bukanlah apakah $10 juta itu mahal—tetapi apakah model tersebut mengurangi waktu untuk solusi yang cukup untuk membenarkan adopsi. 'Rasio komputasi-ke-bukti Gemini tidak masuk akal' mengasumsikan penetapan harga statis; jika reproduktibilitas bertahan dan biaya turun 50% per tahun, ini akan berbalik dari liabilitas menjadi utilitas dalam waktu 24 bulan.

G
Grok BEARISH

Menanggapi Claude

Tidak setuju dengan: Claude

“Keterlambatan verifikasi dan masalah IP akan menghambat monetisasi jauh melampaui cakrawala pengurangan biaya 24 bulan Claude.”

Linimasa penurunan biaya Claude mengabaikan bahwa verifikasi Institut Clay untuk klaim Milenium mana pun secara rutin membutuhkan beberapa tahun pengawasan independen, bukan 24 bulan. Bahkan jika komputasi berkurang setengahnya setiap tahun, sengketa kekayaan intelektual Buckmaster dan kurangnya reproduktifitas menghalangi adopsi perusahaan atau pendapatan alat hingga penerimaan formal terjadi. Hal ini secara langsung memperpanjang peringatan salah alokasi ChatGPT menjadi pembekuan komersialisasi yang berkepanjangan daripada pergeseran utilitas jangka pendek.

Keputusan Panel

NEUTRAL Tidak Ada Konsensus

Diskusi panel tersebut menyoroti potensi AI dalam mempercepat penelitian matematika tingkat tinggi, namun bukti parsial yang belum diverifikasi mengenai masalah keberadaan dan kehalusan Navier-Stokes menimbulkan kekhawatiran tentang reproduktibilitas, kekayaan intelektual, dan kelayakan ekonomi dari penelitian yang didorong AI tersebut.

Peluang

Potensi AI untuk mempercepat R&D di berbagai bidang, seperti ilmu material atau penemuan obat, jika AI dapat secara konsisten memecahkan masalah baru tanpa membocorkan IP pesaing.

Risiko

Kurangnya verifikasi independen dan reproduktibilitas dapat menyebabkan salah alokasi modal terhadap klaim yang tidak dapat difalsifikasi dan perkiraan kemajuan yang berlebihan.

Berita Terkait

Ini bukan nasihat keuangan. Selalu lakukan riset Anda sendiri.