ChatGPT, Claude, atau Gemini untuk IELTS Speaking: keunggulan aplikasi penguji yang dibuat khusus
Di halaman ini
Kamu bisa berlatih IELTS Speaking dengan ChatGPT, Claude, atau Gemini, dan untuk ide, penjelasan, serta waktu bicara sebanyak yang kamu mau, ketiganya memang sangat baik. Namun mereka tidak dibuat untuk menilai. Tidak satu pun halaman pembuatnya sendiri yang menyebut penilaian ucapan berdasarkan band descriptor IELTS, penilaian pelafalan berdasarkan kriteria ujian, atau penghitungan kesalahan yang kamu ulangi dari minggu ke minggu. Untuk tugas khusus itu, yaitu latihan Speaking yang dinilai, berwaktu, dan dilacak, alat yang dibuat khusus sebagai penguji mengerjakan sesuatu yang memang tidak pernah dirancang untuk asisten umum.
Kami membuat IELTS Mentor AI, salah satu aplikasi yang dibahas di sini. Kami berusaha adil; setiap pernyataan tentang ChatGPT, Claude, dan Gemini di bawah ini berasal dari halaman pembuatnya sendiri, diperiksa pada 18 September 2026.
Poin penting
- ChatGPT, Claude, dan Gemini adalah asisten umum yang sangat baik, dan halaman ini tidak membantahnya.
- Pembuatnya menjelaskan fitur suara sebagai percakapan, bukan penilaian — tidak ada halaman yang mengklaim penilaian IELTS, kalibrasi dengan band descriptor, atau penilaian pelafalan.
- Fitur memori mereka mengingat konteks tentang kamu; tidak ada yang dijelaskan sebagai catatan yang menghitung kesalahanmu yang terus berulang.
- Pakai asisten umum untuk ide, pertanyaan, penjelasan, dan tulis ulang; pakai alat bergaya penguji untuk latihan yang dinilai, berwaktu, dan dilacak.
- Jangan percaya begitu saja pada siapa pun, termasuk kami — tes yang adil di bawah ini memakan waktu sekitar sepuluh menit.
Untuk apa sebenarnya ChatGPT, Claude, dan Gemini dibuat
Halaman bantuan OpenAI untuk ChatGPT Voice menyebut fitur ini “lets you speak with ChatGPT and hear a spoken response,” (memungkinkan kamu berbicara dengan ChatGPT dan mendengar jawaban lisan) dan opsi Live “is designed for natural back-and-forth conversation.” (dirancang untuk percakapan bolak-balik yang alami) Halaman bantuan Anthropic menyebut mode suara “allows you to have complete spoken conversations with Claude.” (memungkinkan kamu bercakap-cakap secara lisan dan utuh dengan Claude) Halaman Google untuk Gemini Live menjelaskan “a feature that lets you talk with AI from Google using just your voice.” (fitur yang memungkinkan kamu berbicara dengan AI dari Google hanya dengan suara)
Tiga perusahaan, satu penjelasan: antarmuka suara untuk asisten umum. Tidak ada satu pun halaman itu yang menyebut IELTS, skor band, atau penilaian pelafalan — bukan karena ada yang disembunyikan, melainkan karena produk-produk ini memang bukan untuk itu. Judul Anthropic sendiri untuk Claude adalah “The AI for Problem Solvers.” (AI untuk para pemecah masalah) Sebagai asisten umum, ketiganya luar biasa. Sebagai penguji IELTS, klaim itu sama sekali tidak mereka buat. Opsi suara yang tersedia berbeda menurut paket, wilayah, dan versi aplikasi, jadi periksa halaman pembuatnya.
Empat hal yang benar-benar dilakukan asisten umum dengan baik untuk IELTS
Kebanyakan artikel perbandingan melewatkan bagian ini, padahal inilah yang membuat sisanya layak dipercaya. Beberapa tugas dalam persiapan Speaking memang lebih cocok ditangani asisten umum.
Membuat pertanyaan latihan dan ide. Hambatan bagi peserta tes yang berlatih sendiri sering kali bukan umpan balik, melainkan bahan latihan: kehabisan pertanyaan, atau kehabisan hal yang bisa dikatakan tentang pertanyaan itu.
Give me 10 IELTS Speaking Part 3 questions about technology and society, at the difficulty an examiner would actually use, then three possible angles I could argue for each.
Menjelaskan satu poin tata bahasa sampai kamu paham. Kalau kamu belum melihat mengapa “I have been to London last year” salah, asisten akan menjelaskannya dengan lima cara berbeda, dalam bahasamu sendiri, tanpa kehilangan kesabaran.
Here is my Part 2 answer: [paste your transcript]. For each grammar mistake, explain in my own language why it is wrong, then show the corrected sentence next to my original one.
Memparafrasakan jawaban di level yang lebih tinggi. Melihat idemu sendiri diungkapkan seperti cara peserta tes Band 8 mengungkapkannya, dengan setiap perubahan disebutkan, memperlihatkan jarak antara yang ingin kamu katakan dan yang benar-benar kamu ucapkan.
Rewrite this answer at Band 8 level, keeping my ideas and my story exactly the same. Then list every word and structure you changed, and say what each change is doing.
Menjadi teman bicara yang tak ada habisnya. Asisten itu mau mengobrol denganmu tengah malam, beralih ke bahasa pertamamu untuk menjelaskan sesuatu, lalu beralih kembali, sepanjang yang kamu mau.
Perhatikan kesamaan ketiga prompt itu: tak satu pun meminta skor band.
Yang tidak diklaim satu pun pembuatnya: skor yang berpatokan pada band descriptor
IELTS Speaking dinilai oleh penguji bersertifikat berdasarkan empat kriteria dengan bobot yang sama — Fluency and Coherence (kefasihan dan koherensi), Lexical Resource (penguasaan kosakata), Grammatical Range and Accuracy (ragam dan ketepatan tata bahasa), dan Pronunciation (pelafalan) — dan masing-masing punya band descriptor yang dipublikasikan, band demi band, yang menjelaskan apa yang didengarkan penguji.
Minta skor band dari salah satu dari ketiganya dan kamu akan mendapatkannya. Skor itu akan ditulis dengan baik, terdengar yakin, dan sering kali cukup masuk akal. Tetapi tidak ada satu pun halaman pembuatnya yang menyebut modelnya dikalibrasi dengan band descriptor itu, dicocokkan dengan penilaian penguji, atau bahkan dievaluasi pada IELTS. Angka itu dihasilkan dengan cara yang sama seperti kalimat lain yang terdengar masuk akal, bukan diukur berdasarkan rubrik.
Jangan menerimanya begitu saja. Baca sendiri band descriptor yang dipublikasikan, lalu bandingkan skor apa pun — dari asisten, dari aplikasi, dari mana saja — dengan bunyi band descriptor untuk band yang diklaimnya.
Percakapan bukan ujian: format, waktu, dan pelafalan
Format ujian tidak ada di dalam chat. IELTS Speaking adalah Part 1, lalu cue card (kartu topik) dengan satu menit persiapan dan bicara hingga dua menit, lalu Part 3 — urutan yang tetap, dengan waktu yang tetap. Asisten bisa menjalankan sesuatu yang mirip kalau kamu memintanya, tetapi setelah beberapa giliran ia mulai menyimpang kecuali kamu terus mengarahkannya. Akhirnya kamu mengawasi dirimu sendiri, dan itu menghilangkan tekanan yang memang ingin diciptakan format ujian. Mock test (simulasi tes) lengkap berwaktu ada karena menjalani bentuk ujian adalah keterampilan tersendiri, terpisah dari menjawab pertanyaannya.
Pelafalan adalah kriteria yang dinilai, bukan soal transkripsi. Halaman OpenAI menyarankan kamu mengatur bahasa yang paling sering kamu pakai, karena itu “can help ChatGPT understand your speech more accurately” (dapat membantu ChatGPT memahami ucapanmu dengan lebih akurat) — yang dituju adalah memahamimu, bukan menilaimu. Itu tujuan yang tepat untuk asisten dan tujuan yang salah untuk penguji. IELTS menilai pelafalan dari tekanan kata, ritme, intonasi, dan seberapa besar usaha pendengar untuk memahami, dan tidak ada pembuat yang menjelaskan fitur suaranya menilai satu pun dari itu.
Memori mengingat kamu; ia bukan catatan kesalahan
Inilah poin yang paling mudah disalahpahami. Ketiga asisten itu memang punya memori, dan memori itu nyata.
OpenAI menyebut bahwa dengan Memory aktif, ChatGPT “can remember relevant preferences and details from your chats,” (dapat mengingat preferensi dan detail yang relevan dari obrolanmu) tetapi juga menyatakan bahwa ChatGPT “does not retain every detail from every conversation” (tidak menyimpan setiap detail dari setiap percakapan) dan bahwa “ChatGPT decides which available information is relevant to a response.” (ChatGPT memutuskan informasi mana yang relevan untuk sebuah jawaban) Anthropic menyebut Claude “saves memory as a set of individual topics as you chat, rather than summarizing conversations after they end.” (menyimpan memori sebagai kumpulan topik terpisah selama kamu mengobrol, alih-alih merangkum percakapan setelah selesai) Google menjelaskan personalisasi yang memungkinkan Gemini “learn from your chats to understand more about you and your world” (belajar dari obrolanmu untuk lebih memahami kamu dan duniamu) — dan mencatat bahwa memori obrolan sebelumnya “not available in certain features, like Gems or Live chats,” (tidak tersedia di fitur tertentu, seperti Gems atau obrolan Live) yang persis menjadi tempat sesi latihan lisan berlangsung.
Semua itu adalah memori tentang kamu: preferensimu, konteksmu, topik yang sering kamu bahas. Yang tidak dijelaskan sebagai bagian darinya adalah catatan kumulatif tentang kesalahan yang terus berulang pada satu pelajar — catatan yang menyebut bahwa kamu melewatkan “-s” orang ketiga di sembilan dari dua belas jawaban terakhirmu, bahwa ini menahan skor Grammatical Range and Accuracy, dan bahwa inilah yang seharusnya menjadi sasaran latihan hari ini. Mengingat bahwa kamu sedang mempersiapkan IELTS tidak sama dengan menghitung apa yang terus salah — dan aplikasi yang menjelaskan kesalahanmu dirancang berdasarkan penghitungan itu.
Tes yang adil yang bisa kamu jalankan dalam sekitar sepuluh menit
Jangan memutuskannya dari sebuah artikel. Transkripsikan salah satu jawaban rekamanmu sendiri dan jalankan tiga pemeriksaan.
Konsistensi. Tempelkan transkrip yang sama ke dua chat yang benar-benar baru dan minta masing-masing memberi skor band lengkap dengan rincian per kriteria. Pengukuran yang berpatokan seharusnya mendarat di tempat yang sama dua kali. Kalau angkanya berbeda, kamu jadi tahu seberapa besar bobot yang layak diberikan pada masing-masing.
Pembenaran. Minta ia mengutip bunyi band descriptor yang persis di balik angka setiap kriteria, lalu cocokkan bunyi itu dengan band descriptor yang dipublikasikan. Skor yang tidak bisa menunjuk bunyi band descriptor di baliknya hanyalah tebakan yang memakai seragam.
Catatannya. Seminggu dan beberapa sesi kemudian, tanyakan kesalahan mana yang paling sering kamu ulangi, dan berapa kali, lalu cocokkan dengan apa yang sebenarnya kamu ucapkan. Itulah sebabnya penilaian otomatis sebaiknya diukur dari konsistensinya dari waktu ke waktu, bukan dari satu jawaban yang terdengar yakin.
Perbandingannya, baris demi baris
| Yang kamu butuhkan untuk IELTS Speaking | ChatGPT, Claude, atau Gemini | Aplikasi penguji yang dibuat khusus untuk IELTS |
|---|---|---|
| Dibuat berdasarkan format IELTS Speaking | Bukan fitur yang dirancang; pembuatnya menjelaskan asisten umum dan percakapan | Ya; formatnya adalah produknya |
| Dinilai berdasarkan keempat kriteria resmi | Hanya kalau kamu memintanya, dan tidak ada halaman pembuat yang menyebut kalibrasi dengan band descriptor | Ya — Fluency and Coherence, Lexical Resource, Grammatical Range and Accuracy, Pronunciation |
| Rentang band, bukan satu angka | Hanya kalau kamu memintanya, dan tidak ada patokan untuk kedua ujungnya | Ya — pembacaan yang lebih ketat dan yang lebih longgar atas jawaban yang sama |
| Pelafalan dinilai dari ucapanmu yang sebenarnya | Bukan fitur yang dijelaskan; mode suara dibuat untuk percakapan, dengan tujuan memahami kamu | Ya — dinilai dari apa yang kamu rekam |
| Catatan berjalan tentang kesalahan yang kamu ulangi | Memori ada dan menyimpan konteks tentang kamu, tetapi tidak ada yang dijelaskan sebagai catatan kesalahan dengan hitungan | Ya — dilacak lintas sesi, masing-masing dengan dampaknya pada band |
| Waktu ujian di Part 1, 2, dan 3 | Hanya kalau kamu menyusunnya dengan prompt dan menghitung waktu sendiri | Ya — Part 1, 2, dan 3 lengkap, berwaktu |
| Ide, pertanyaan latihan, dan penjelasan | Ya — kekuatan yang nyata, sulit dikalahkan | Lebih sempit, memang disengaja; dibuat untuk menilai, bukan untuk mencari ide |
| Bantuan dalam bahasamu sendiri | Ya — ketiganya bekerja di banyak bahasa | Berbeda-beda per aplikasi; isi ujiannya sendiri tetap berbahasa Inggris |
Diperiksa pada 18 September 2026 terhadap halaman pembuatnya sendiri: artikel bantuan OpenAI tentang ChatGPT Voice dan Memory; artikel bantuan Anthropic tentang mode suara dan memori serta ikhtisar Claude; ikhtisar Gemini Live dari Google dan halaman bantuannya tentang memori obrolan sebelumnya. Ketersediaan fitur suara berbeda menurut paket, wilayah, dan versi aplikasi.
Pembagian tugas yang jujur
Kesalahannya bukan memakai ChatGPT, Claude, atau Gemini untuk IELTS. Kesalahannya adalah meminta satu alat mengerjakan dua tugas yang nyaris tidak punya kesamaan.
Pakai asisten umum untuk separuh yang terbuka: pertanyaan sebanyak yang kamu mau, ide yang tidak akan terpikir olehmu, tata bahasa yang dijelaskan sampai kamu benar-benar paham, jawabanmu ditulis ulang satu level lebih tinggi dengan perubahan yang disebutkan, dalam bahasamu sendiri kapan pun itu lebih cepat. Tidak ada aplikasi penguji yang bisa mengalahkannya dalam hal ini.
Pakai alat bergaya penguji untuk separuh yang diukur: jawaban yang dinilai pada keempat kriteria, rentang band alih-alih satu angka yang presisinya palsu, pengaturan waktu ujian itu sendiri di Part 1 sampai 3, dan catatan kesalahan mana yang terus muncul, supaya latihan hari ini menyasar kesalahan yang benar-benar membuatmu kehilangan skor. Itulah tugas sempit yang menjadi alasan IELTS Mentor AI dibuat, sempit dengan sengaja. Pembagian yang sama berlaku kalau kamu mempersiapkan diri sepenuhnya sendiri: asisten adalah teman belajarmu, sedangkan latihan yang dinilai adalah cek realitasmu.
Kedua separuh itu penting. Namun hanya satu di antaranya yang diklaim oleh perusahaan-perusahaan yang produknya akan kamu percayai untuk tugas itu.
Pertanyaan yang sering diajukan
Bisakah saya memakai ChatGPT untuk latihan IELTS Speaking?
Bisa, dan ChatGPT memang berguna untuk sebagian latihan: membuat pertanyaan latihan, menjelaskan mengapa sebuah kalimat salah, menulis ulang jawabanmu di level yang lebih tinggi, dan membahas ide dalam bahasamu sendiri. Yang tidak dirancang untuk ChatGPT adalah menilai jawaban lisanmu berdasarkan empat kriteria IELTS, menilai pelafalanmu dari audio, atau memberi tahu kesalahan mana yang kini kamu ulangi di sebelas dari dua belas sesi. Pakai ChatGPT untuk tugas pertama, lalu pakai alat yang dibuat khusus untuk ujian bagi tugas kedua.
Apakah ChatGPT akurat untuk memprediksi skor band IELTS?
Dari luar, tidak ada cara untuk mengetahuinya, karena halaman OpenAI sendiri sama sekali tidak menyebut ChatGPT dikalibrasi dengan band descriptor IELTS. Angka band yang dihasilkannya adalah perkiraan yang terdengar masuk akal, bukan pengukuran yang berpatokan pada band descriptor. Kamu bisa mengujinya sendiri dalam beberapa menit: tempelkan transkrip yang sama ke dua chat baru yang terpisah dan bandingkan angkanya, lalu minta ChatGPT mengutip bunyi band descriptor yang mendasari tiap angka.
Bisakah Gemini atau Claude menilai IELTS Speaking saya?
Keduanya akan memberi skor kalau kamu memintanya, tetapi halaman produk Google maupun Anthropic tidak menyebut penilaian IELTS, band descriptor, atau penilaian pelafalan sebagai sesuatu yang dilakukan asisten mereka. Google menjelaskan Gemini Live sebagai cara berbicara dengan AI dari Google hanya dengan suara; Anthropic menjelaskan mode suara sebagai percakapan lisan dengan Claude. Kedua penjelasan itu bicara soal percakapan, bukan penilaian.
Bisakah ChatGPT memeriksa pelafalan saya untuk IELTS?
Tidak dalam arti yang dimaksud ujian. Halaman bantuan OpenAI menjelaskan fitur suara sebagai berbicara dengan ChatGPT dan mendengar jawaban lisan, serta menyarankan kamu mengatur bahasa agar ChatGPT bisa memahami ucapanmu dengan lebih akurat. Itu soal asisten yang memahamimu, bukan menilaimu. Pronunciation di IELTS adalah kriteria yang dinilai dan mencakup tekanan kata, intonasi, dan kejelasan ucapan, sehingga memerlukan alat yang dibuat untuk menilainya dari rekaman.
Sebaiknya saya pakai aplikasi IELTS atau cukup ChatGPT, Claude, atau Gemini?
Kebanyakan peserta tes paling terbantu kalau memakai keduanya, masing-masing untuk tugas yang berbeda. Asisten umum adalah sumber ide, pertanyaan, penjelasan, dan hasil tulis ulang di level lebih tinggi yang sangat baik dan tak kenal lelah, dalam bahasamu sendiri kalau kamu mau. Aplikasi bergaya penguji dipakai untuk bagian yang harus diukur: skor per kriteria, satu sesi Part 1 sampai 3 yang berwaktu, dan catatan kesalahan mana yang terus kembali. Yang satu tidak menggantikan yang lain.
Artikel lain di blog
IELTS Writing Task 1 General Training: cara menulis surat
Cara memilih nada yang tepat, membuka dan menutup dengan benar, dan mencakup ketiga poin dalam surat IELTS General Training Task 1 yang panjangnya 150 kata atau lebih.
IELTS Mentor AI menambahkan Reading dan Listening — apa yang berubah
IELTS Mentor AI kini menilai tes Reading Academic lengkap dan tes Listening lengkap, dengan penyorotan bukti dan peninjauan dengan mendengarkan ulang. Apa yang baru, dan apa yang tetap sama.