Introduksi
Kode AI yang lulus tes industri tidak selalu berarti bahwa kode tersebut akan diterima oleh pengembang sebenarnya. Penelitian baru oleh METR menemukan bahwa setengah kode AI yang lulus tes industri akan ditolak oleh pengembang sebenarnya.
Detail Teknis
Penelitian ini menggunakan benchmark SWE-bench Verified, yang dianggap sebagai standar emas untuk mengevaluasi kemampuan kode AI. Namun, penelitian ini menemukan bahwa benchmark ini secara signifikan melebih-lebihkan kemampuan kode AI dalam pengembangan perangkat lunak dunia nyata.
Fitur Utama
- Penelitian ini menemukan bahwa setengah kode AI yang lulus tes industri akan ditolak oleh pengembang sebenarnya.
- Penolakan ini tidak hanya karena masalah gaya kode, tetapi juga karena kesalahan fungsional dasar.
- Penelitian ini juga menemukan bahwa benchmark SWE-bench Verified melebih-lebihkan kemampuan kode AI dalam pengembangan perangkat lunak dunia nyata.
Pendapat Geek
Penelitian ini menimbulkan pertanyaan tentang validitas benchmark SWE-bench Verified dan kemampuan kode AI dalam pengembangan perangkat lunak dunia nyata. Namun, perlu diingat bahwa penelitian ini tidak membuktikan bahwa kode AI memiliki batas kemampuan fundamental. Dengan demikian, masih ada harapan bahwa kode AI dapat ditingkatkan dengan strategi prompting yang lebih baik dan umpan balik manusia.



