Penipuan video call adalah modus kejahatan di mana pelaku menggunakan panggilan video untuk menipu korban dengan berpura-pura menjadi orang lain bisa mengaku sebagai pihak bank, instansi pemerintah, kerabat, atau rekan bisnis. Yang membuat modus ini semakin berbahaya: teknologi deepfake real-time kini memungkinkan pelaku mengubah wajah mereka menjadi wajah orang lain selama video call berlangsung.
Jika sebelumnya penipuan telepon mengandalkan suara dan manipulasi emosional, penipuan video call menambahkan dimensi visual yang sangat meyakinkan. Korban 'melihat' wajah yang dikenali dan ini menghancurkan barrier of skepticism yang selama ini menjadi pertahanan utama terhadap social engineering.
Pelaku berpura-pura menjadi customer service bank atau petugas instansi, menggunakan background yang meyakinkan (logo bank, seragam) dan skrip yang terstruktur. Tidak ada manipulasi visual mengandalkan penampilan dan social engineering.
Pelaku menggunakan video rekaman korban atau target impersonasi yang diambil dari media sosial, diputar selama video call. Keterbatasan: tidak bisa merespons secara real-time, mudah terdeteksi jika diminta melakukan gerakan spesifik.
Tools seperti DeepFaceLive memungkinkan face swap real-time selama video call. Pelaku menjalankan software yang mengganti wajahnya dengan wajah target secara live mulut bergerak sesuai ucapan, ekspresi mengikuti gerakan alami, dan hasilnya dikirimkan langsung ke aplikasi video conference. Ini bukan lagi skenario futuristik tools ini tersedia gratis dan bisa dijalankan di laptop consumer-grade.
Banyak lembaga keuangan menggunakan video call sebagai metode verifikasi identitas terutama untuk nasabah yang tidak bisa hadir secara fisik. Operator manusia melakukan video call dengan pemohon, memverifikasi wajah dengan foto KTP, dan menanyakan pertanyaan keamanan. Metode ini dianggap lebih aman dari selfie-based verification karena ada elemen 'live interaction.'
Real-time deepfake menghancurkan asumsi ini. Jika operator tidak bisa membedakan wajah asli dari deepfake dan penelitian menunjukkan bahwa manusia gagal mendeteksi deepfake berkualitas tinggi dalam 40-60% kasus maka video call verification tidak lebih aman dari verifikasi foto.
Lebih problematis: video call verification menciptakan false sense of security. Lembaga merasa sudah melakukan verifikasi yang 'paling ketat' padahal layer ini bisa ditembus oleh tools yang tersedia secara bebas.
Di luar konteks KYC, penipuan video call terhadap individu juga meningkat tajam:
Otak manusia memproses wajah secara holistik kita mengenali keseluruhan, bukan detail piksel per piksel. Deepfake modern cukup baik untuk melewati threshold pengenalan holistik ini, terutama dalam kondisi video call yang biasanya memiliki kualitas gambar yang terbatas, latency yang menciptakan jeda natural, pencahayaan yang tidak ideal, dan durasi yang singkat sehingga tidak memungkinkan observasi mendalam.
Artinya, mengandalkan operator manusia atau bahkan korban sendiri untuk mendeteksi deepfake adalah strategi yang fundamentally flawed.
Deteksi deepfake yang efektif harus bekerja di level yang tidak terlihat oleh mata manusia:
VIDA Liveness Detection mengkombinasikan passive liveness (mendeteksi kehadiran fisik tanpa instruksi aktif ke pengguna), anti-injection (mendeteksi virtual camera dan software injection), dan device intelligence (mendeteksi environment yang mencurigakan). Kombinasi ini mendeteksi deepfake baik presentation attack (layar/foto ditampilkan ke kamera) maupun injection attack (video sintetis disuntikkan ke pipeline) dua vektor serangan yang masing-masing membutuhkan teknik deteksi berbeda.
Untuk individu, awareness tetap menjadi pertahanan utama: jika seseorang menghubungi via video call dan meminta tindakan finansial mendesak bahkan jika wajahnya familiar verifikasi melalui channel terpisah sebelum bertindak. Jangan pernah mengandalkan visual saja untuk membuktikan identitas seseorang di era deepfake.