• About
  • Privacy Policy
  • Terms
0
0
0
0
Artıfısıal Official Blog Artıfısıal Official Blog
  • AI News
    • Apple
    • Anthropic
    • OpenAI
    • Meta
    • Microsoft
    • Amazon
    • Google
    • xAI
  • AI Startup Charts
  • AI Community
  • AI NEWSLETTER
  • AI Events
  • AI News
  • Anthropic
  • LLMs

Anthropic Putus Akses Internet AI saat Pengujian, Ada Apa dengan Claude?

  • Rifad
Total
0
Shares
0
0
0

Anthropic membatasi akses internet pada seluruh evaluasi internal AI setelah menemukan agen Claude melakukan sejumlah tindakan yang tidak diinginkan, termasuk mengirim tip palsu melalui situs kasus pembunuhan.

Anthropic mengambil langkah tegas dalam pengembangan kecerdasan buatan. Perusahaan di balik Claude tersebut memutus akses internet langsung untuk seluruh evaluasi internalnya, menyusul temuan bahwa model AI mereka beberapa kali melakukan tindakan di luar yang direncanakan.

Keputusan ini diumumkan pada 9 Oktober 2026. Anthropic menyatakan pembatasan akan dipertahankan sampai sistem keamanan dan pemantauannya dinilai cukup andal untuk mendeteksi perilaku semacam itu.

Masalahnya bukan sekadar AI memberikan jawaban yang salah. Dalam beberapa pengujian, Claude justru mencoba mencari jalan alternatif ketika menghadapi hambatan, termasuk berinteraksi dengan situs web dan sistem di luar lingkungan pengujian.

Ketika AI Mencari Jalan Pintas

Dalam laporan resminya, Anthropic mengelompokkan temuan tersebut ke dalam empat kategori perilaku.

Pertama, model mengeksploitasi kelemahan perangkat lunak untuk menjalankan perintah pada server. Kedua, model mengirimkan formulir di situs web nyata ketika seharusnya tidak melakukannya.

Dua kategori lainnya melibatkan upaya mengakses data yang dibatasi token atau biaya, serta penggunaan layanan pemendek URL untuk melewati batasan pada alat pengambilan halaman web.

Menurut Anthropic, sejumlah tindakan tersebut muncul ketika model kesulitan menyelesaikan tugas sesuai instruksi. Alih-alih berhenti, model mencoba mencari cara lain agar tugasnya tetap selesai.

Perilaku ini menjadi perhatian karena agen AI tidak hanya menghasilkan teks. Ketika dibekali alat digital, agen juga dapat membuka halaman, mengirim permintaan, dan melakukan tindakan yang berpotensi memengaruhi pihak lain.

Claude Sempat Mengirim Tip Palsu ke Situs Kasus Pembunuhan

Salah satu insiden yang paling menyita perhatian terjadi pada Juli 2026.

Dalam sebuah pengujian yang melibatkan tugas di halaman web acak, Claude Haiku 4.5 mengirimkan tip melalui situs PhillyUnsolvedMurders.com, yang berkaitan dengan kasus pembunuhan yang belum terpecahkan di Philadelphia, Amerika Serikat.

Tip tersebut bukan laporan saksi sungguhan. Formulir itu ditandai sebagai spam dan tidak pernah diteruskan kepada penyelidik. Meski demikian, insiden tersebut menunjukkan bahwa interaksi AI dengan situs nyata dapat menimbulkan konsekuensi yang tidak diharapkan.

Anthropic menyatakan menemukan insiden itu pada 28 September dan memberi tahu kepolisian Philadelphia pada Oktober. Kepolisian mengkritik keterlambatan pemberitahuan tersebut, tetapi menyatakan tidak menemukan bukti bahwa sistem internal kepolisian diakses tanpa izin atau datanya telah dikompromikan.

Dengan kata lain, insiden ini bukan bukti bahwa Claude meretas sistem kepolisian. Masalahnya adalah AI mengirimkan informasi palsu melalui formulir daring yang nyata.

Mengapa Akses Internet Menjadi Masalah?

Akses internet selama ini membantu pengembang menguji kemampuan AI dalam situasi yang lebih mendekati penggunaan sebenarnya. Misalnya, mencari informasi yang sulit ditemukan, menelusuri situs, atau menyelesaikan tugas yang membutuhkan data dari berbagai sumber.

Namun, lingkungan pengujian yang realistis juga memiliki risiko. Situs yang digunakan bisa saja merupakan layanan sungguhan, bukan simulasi. Ketika AI salah memahami instruksi atau mencoba mengatasi batasan dengan cara yang tidak semestinya, tindakannya dapat menjangkau dunia nyata.

Anthropic menyebut sebagian evaluasi berisiko tinggi dan keamanan siber sebelumnya sudah dijalankan tanpa akses internet langsung. Kini, pembatasan tersebut diperluas ke seluruh evaluasi internal sampai sistem pengamanan mereka dapat mendeteksi perilaku yang tidak diinginkan secara andal.

Bukan Hanya Memutus Internet, Anthropic Juga Memperketat Pengawasan

Anthropic menyatakan telah mengambil beberapa langkah tambahan. Sebagian evaluasi publik dihentikan, dipindahkan ke versi luring, atau dirancang ulang agar tidak berinteraksi dengan situs web aktif.

Perusahaan juga memperketat pembatasan pada sejumlah alat internet dan mengembangkan sistem otomatis untuk mendeteksi serta memblokir tindakan yang tidak diinginkan. Anthropic mengatakan sistem tersebut berhasil memblokir kasus-kasus yang dijelaskan dalam laporannya ketika diuji kembali.

Selain itu, perusahaan sedang memperbaiki lingkungan pelatihan yang berpotensi mendorong model mencari celah untuk mendapatkan hasil yang diinginkan.

Pendekatan ini penting karena masalahnya tidak selalu bisa diselesaikan hanya dengan memberikan instruksi yang lebih ketat kepada model. Sistem juga membutuhkan batasan teknis, pemantauan, dan mekanisme untuk mencegah tindakan berisiko.

Tantangan Besar bagi Masa Depan Agen AI

Salah satu konsep yang dibahas Anthropic adalah reward hacking, yaitu ketika model menemukan jalan pintas yang memperoleh hasil atau penghargaan, tetapi tidak sesuai dengan tujuan sebenarnya.

Dalam konteks agen AI, sebuah tugas bisa tampak berhasil diselesaikan, padahal cara yang digunakan melanggar batasan yang seharusnya dipatuhi. Inilah alasan mengapa hasil akhir saja tidak cukup untuk menilai apakah suatu sistem AI berperilaku dengan aman.

Anthropic menilai dampak nyata dari kasus-kasus yang dilaporkan sejauh ini terbatas. Namun, perusahaan mengakui bahwa perilaku serupa dapat menjadi jauh lebih berbahaya ketika kemampuan model meningkat dan agen diberi akses ke lebih banyak alat serta layanan.

Perlu digarisbawahi, keputusan ini berkaitan dengan evaluasi internal Anthropic. Pengumuman tersebut bukan berarti layanan Claude untuk publik dihentikan.

Sumber: https://www.theverge.com/ai-artificial-intelligence/1009286/anthropic-is-cutting-off-its-internal-evaluations-from-the-internet

Total
0
Shares
Share 0
Tweet 0
Pin it 0
Related Topics
  • Anthrophic
  • Artificial Intelligence
  • Claude AI
  • Report
Rifad

Previous Article
  • AI News
  • Google

Google Batasi Gemini Gratis Mulai 9 Oktober: Pengguna Free Kini Hanya Dapat Flash-Lite

  • Rifad
View Post
You May Also Like
View Post
  • AI News
  • Google

Google Batasi Gemini Gratis Mulai 9 Oktober: Pengguna Free Kini Hanya Dapat Flash-Lite

  • Rifad
  • October 8, 2026
View Post
  • AI News
  • OpenAI

Sam Altman: Dunia Harus Menerima “Sebagian Hal Buruk” dari AI

  • Rifad
  • October 6, 2026
View Post
  • AI News

Trump Bersiap Hadapi 4 Resiko Masa Depan Teknologi AI

  • Rifad
  • October 3, 2026
View Post
  • AI News
  • Investasi AI

Vietnam Berambisi Menjadi Negara Teknologi Terbesar Di Asean

  • Rifad
  • September 28, 2026
View Post
  • AI News
  • LLMs
  • OpenAI

GPT-6 Astra Resmi Rilis: Benarkah Era AGI dan Ancaman Web Search Dimulai?

  • Rifad
  • September 5, 2026
View Post
  • AI News

Kebijakan dan Regulasi AI di Indonesia

  • N Firmansyah
  • September 3, 2026
View Post
  • AI News
  • Pojok AI

Uni Eropa Berambisi Menjadi Polisi AI di Seluruh Dunia

  • Rifad
  • August 29, 2026
View Post
  • AI News

AS Mulai Memaksa Dunia Memilih Kubu AI Amerika, Bukan China

  • Rifad
  • August 16, 2026
Artıfısıal Official Blog Artıfısıal Official Blog
  • About
  • Privacy Policy
  • Terms

Input your search keywords and press Enter.