TheAIMeters Logo

Apa Itu Inferensi AI?

Inferensi AI adalah saat model yang telah dilatih digunakan untuk menjawab prompt, menghasilkan konten, mengklasifikasikan data, atau membuat prediksi berdasarkan masukan baru.

Diagram showing a user input flowing into a trained AI model and returning an output
Inferensi AI mengubah input baru menjadi output dengan menjalankan model yang telah dilatih pada data aktual, alih-alih melatih model tersebut dari awal.

Prompt AI yang diproses hari ini (perkiraan)

 meminta

Perkiraan jumlah perintah AI yang diproses hari ini di seluruh sistem AI di seluruh dunia.

Poin utama

Inferensi AI bukanlah pelatihan model. Ini adalah tahap di mana model yang telah dilatih digunakan untuk memproses masukan baru dan menghasilkan jawaban, prediksi, klasifikasi, atau keluaran yang dihasilkan.

Daftar Isi

Inferensi adalah saat model AI digunakan

Inferensi AI terjadi setelah sebuah model telah dilatih. Seorang pengguna, aplikasi, atau sistem otomatis mengirimkan masukan baru, dan model yang telah dilatih tersebut menggunakan apa yang telah dipelajarinya selama proses pelatihan untuk menghasilkan keluaran yang bermanfaat.

Masukan tersebut bisa berupa petunjuk tertulis, kueri pencarian, gambar produk, rekaman suara, baris kode, atau baris dalam basis data. Keluaran tersebut bisa berupa jawaban, gambar yang dihasilkan, klasifikasi, rekomendasi, terjemahan, atau prediksi.

Inilah sebabnya mengapa setiap respons ChatGPT, hasil pembangkitan gambar berbasis AI, hasil asisten pencarian, mesin rekomendasi, dan keputusan moderasi konten melibatkan proses inferensi. Model tersebut tidak dibangun ulang setiap kali; melainkan dijalankan pada data baru.

Pelatihan membangun model, sedangkan inferensi menjalankannya

Pelatihan dan inferensi adalah dua fase berbeda dari sistem AI yang sama. Pelatihan menciptakan atau memperbarui model dengan memproses kumpulan data besar, membandingkan prediksi dengan contoh-contoh, dan menyesuaikan parameter internal melalui banyak langkah yang diulang-ulang.

Proses inferensi dimulai setelah proses pelatihan tersebut menghasilkan model yang dapat digunakan. Model yang telah dilatih tersebut diimplementasikan pada server, menerima masukan baru, dan menerapkan pola-pola yang telah dipelajarinya tanpa harus melalui proses pelatihan secara penuh lagi.

Cara sederhana untuk mengingat perbedaannya adalah sebagai berikut: pelatihan adalah proses bagaimana model belajar, sedangkan inferensi adalah cara model tersebut digunakan. Untuk penjelasan lebih mendalam mengenai tahap pertama, lihat panduan tentang cara melatih model AI.

Diagram comparing AI training and AI inference workflows
Pelatihan membangun sebuah model berdasarkan data dan proses komputasi. Inferensi menggunakan model yang telah dilatih tersebut dengan masukan baru untuk menghasilkan keluaran.

Apa yang terjadi selama proses inferensi AI?

Langkah-langkah pastinya bergantung pada jenis modelnya, tetapi alur dasarnya serupa. Sebuah masukan masuk, sistem menyiapkannya dalam format yang diharapkan oleh model, model melakukan perhitungan terhadap parameter-parameternya, dan sistem mengubah keluaran model menjadi sesuatu yang dapat dibaca, dilihat, atau digunakan oleh pengguna.

Pada model bahasa, prompt biasanya dipecah menjadi token-token. Model tersebut menganalisis token-token tersebut dan memprediksi token berikutnya yang paling mungkin, selangkah demi selangkah. Pada model gambar, masukan dapat berupa teks, gambar, atau keduanya, dan model tersebut secara bertahap menghasilkan piksel atau fitur visual yang sesuai dengan permintaan.

Sistem lain mungkin dapat mengklasifikasikan dokumen, menentukan peringkat hasil pencarian, mendeteksi objek dalam sebuah gambar, mentranskripsikan ucapan, atau merekomendasikan produk. Dalam setiap kasus tersebut, inferensi adalah langkah eksekusi secara real-time yang mengubah masukan baru menjadi keluaran model.

Mengapa inferensi memerlukan daya komputasi

Inferensi AI bukanlah sekadar pencarian sederhana dalam basis data. Sebuah model besar dapat berisi miliaran parameter, dan penggunaannya memerlukan banyak operasi matematis untuk mengalirkan informasi melalui model tersebut serta menghitung hasil berikutnya.

Perhitungan ini sering kali harus dilakukan dengan cepat. Jawaban dari chatbot, respons asisten pencarian, atau terjemahan real-time harus muncul dalam hitungan detik atau bahkan lebih cepat, sehingga sistem inferensi sangat memperhatikan latensi, bandwidth memori, pengelompokan (batching), ukuran model, dan pemanfaatan perangkat keras.

GPU dan akselerator AI lainnya sangat berguna karena mampu menjalankan banyak operasi paralel secara efisien. Semakin besar modelnya, semakin panjang konteksnya, dan semakin banyak pengguna yang menggunakan layanan secara bersamaan, maka infrastruktur inferensi harus dirancang dengan lebih cermat.

Contoh-contoh penalaran dalam kecerdasan buatan (AI) sehari-hari

Ketika sebuah chatbot menjawab sebuah pertanyaan, chatbot tersebut sedang melakukan inferensi. Hal yang sama juga berlaku ketika sebuah generator gambar membuat gambar berdasarkan prompt, asisten pemrograman menyarankan sebuah fungsi, atau alat terjemahan mengubah sebuah kalimat ke dalam bahasa lain.

Inferensi juga terdapat dalam sistem-sistem yang kurang terlihat. Baik itu umpan rekomendasi yang menentukan peringkat video, sistem pendeteksi penipuan yang menandai suatu transaksi, model pencitraan medis yang menyoroti area yang menjadi fokus, maupun sistem penglihatan pabrik yang mendeteksi cacat—semuanya menggunakan model yang telah dilatih pada data baru.

Contoh-contoh ini terlihat berbeda bagi pengguna, tetapi memiliki pola dasar yang sama: sebuah model yang telah dilatih menerima masukan, melakukan perhitungan, dan menghasilkan keluaran yang mendukung suatu keputusan, jawaban, atau hasil yang dihasilkan.

Mengapa inferensi penting bagi sektor energi dan infrastruktur

Satu permintaan inferensi mungkin berukuran kecil, tetapi sistem AI modern beroperasi dalam skala yang sangat besar. Jutaan atau miliaran prompt, permintaan gambar, rekomendasi, dan panggilan API dapat menimbulkan permintaan yang terus-menerus terhadap GPU, jaringan, penyimpanan, dan sistem pendingin.

Inilah sebabnya mengapa inferensi memegang peranan sentral dalam infrastruktur AI. Meskipun pelatihan mungkin merupakan proses komputasi yang paling terlihat, inferensi justru dilakukan berulang kali setiap kali orang menggunakan alat AI yang telah diterapkan. Dalam skala global, penggunaan berulang tersebut dapat menjadi pendorong utama permintaan GPU dan konsumsi listrik di pusat data.

Biaya energi yang tepat untuk satu kueri AI bergantung pada ukuran model, perangkat keras, pengelompokan (batching), tingkat pemanfaatan, efisiensi pusat data, dan jenis hasilnya. Poin pentingnya adalah bahwa proses inferensi menghubungkan penggunaan AI sehari-hari dengan infrastruktur fisik: chip, server, daya listrik, sistem pendingin, dan pusat data.

Bagaimana inferensi dioptimalkan

Penyedia layanan AI mengerahkan banyak upaya teknis untuk membuat proses inferensi menjadi lebih cepat, lebih murah, dan lebih efisien. Pengelompokan (batching) memungkinkan pemrosesan beberapa permintaan secara bersamaan, penyimpanan dalam cache (caching) memungkinkan penggunaan kembali hasil kerja yang berulang, dan perutean (routing) memungkinkan pengalihan tugas-tugas yang lebih sederhana ke model yang lebih kecil atau khusus.

Teknik-teknik lain dapat mengurangi beban komputasi yang diperlukan. Kuantisasi dapat merepresentasikan nilai-nilai model secara lebih ringkas, distilasi dapat mentransfer perilaku ke dalam model yang lebih kecil, dan pemangkasan atau perubahan arsitektur dapat menghilangkan proses yang tidak perlu sambil tetap mempertahankan kualitas yang berguna.

Perangkat keras khusus juga berperan penting. GPU, akselerator AI, jaringan berkecepatan tinggi, dan memori berbandwidth tinggi membantu model yang telah diterapkan merespons secara andal dalam skala besar. Efisiensi inferensi yang lebih baik dapat mengurangi latensi, biaya, dan konsumsi listrik, namun hal itu tidak membuat infrastruktur menjadi tidak diperlukan.

Bacaan lebih lanjut dan referensi

Panduan terkait infrastruktur AI

Artikel terkait

Bagaimana model AI dilatih

Model AI dilatih dengan mempelajari pola dari dataset besar, menyesuaikan parameter internal, lalu menggunakan pola tersebut untuk merespons input baru. Proses pelatihan ini adalah dasar cara kerja model AI.

Polusi Suara di Pusat Data

Pusat data dapat menimbulkan kebisingan yang terus-menerus dari sistem pendingin, peralatan listrik, generator cadangan, dan infrastruktur dengan kepadatan tinggi. AI tidak membuat setiap lokasi menjadi bising, tetapi fasilitas berskala AI dapat membuat masalah ini lebih terasa bagi masyarakat di sekitarnya.

Mengapa AI mengkonsumsi begitu banyak listrik?

AI memakai begitu banyak listrik karena pelatihan, inferensi, dan deployment skala global bergantung pada infrastruktur yang intensif komputasi.

Apa itu MCP dalam AI? Model Context Protocol dijelaskan

MCP, atau Model Context Protocol, adalah protokol terbuka untuk menghubungkan aplikasi AI dengan alat eksternal, sumber data, dan alur kerja melalui antarmuka standar.

Apakah Pusat Data AI Berbahaya bagi Lingkungan?

Pusat data AI tidak secara otomatis berdampak buruk bagi lingkungan, namun dampaknya bergantung pada kebutuhan listrik, komposisi jaringan listrik, penggunaan air, desain sistem pendinginan, kendala lokal, dan transparansi.

Mengapa Pusat Data AI Menggunakan Air Sebanyak Itu?

Pusat data AI menggunakan air karena server GPU dengan kepadatan tinggi menghasilkan panas yang harus terus-menerus dibuang. Pendinginan berbasis air bisa jadi efisien, namun dampaknya di tingkat lokal bergantung pada iklim, desain sistem pendinginan, pembangkit listrik, dan ketersediaan air.

Pertanyaan terkait

Bagikan halaman ini