একটি বানানো কণ্ঠ
একটি কণ্ঠ তৈরি হয় হারমোনিক চাপিয়ে চাপিয়ে, তার পর সেগুলিকে স্বরযন্ত্রের নালির মতো অনুনাদিত করে। এই প্রদর্শন একই শব্দ দুবার বানায়, একবার মোটা দাগে আর একবার যত্ন করে, আর আপনাকে মিলিয়ে দেখতে দেয় কী শোনা যায় আর কী তার রেখাচিত্রে দেখা যায়।
সবই আপনার ব্রাউজারে হিসাব হয়। দুটি শব্দই এই ডিভাইসে তৈরি হয়, তাদের স্পেকট্রাম সেখানেই হিসাব হয়, আর কোনো শব্দ কোনো সার্ভারে পাঠানোও হয় না, সেখান থেকে আসেও না। আপনার ব্রাউজারের নেটওয়ার্ক ট্যাব খুলুন আর প্রদর্শনটি নাড়াচাড়া করুন: কোনো অনুরোধই বাইরে যায় না। “শুনুন” বোতাম দুটি শব্দ বাজায়: শুনতে চাইলে আওয়াজ বাড়িয়ে নিন, নয়তো সোজা রেখাচিত্রগুলিই পড়ুন, যেগুলির বর্ণনা শব্দ ছাড়াই পড়ার মতো করে দেওয়া আছে।
একই একটি শব্দ, দুবার বানানো
এই পাতার দুটি শব্দ একই জায়গা থেকেই শুরু হয়: একই উচ্চতা, একই বীজ, এক সেকেন্ডের একই দৈর্ঘ্য। একটিকে কাঁচাই রাখা হয়, অন্যটি বাড়তি একটি প্রক্রিয়া পায়, যার বর্ণনা নিচে “পদ্ধতি” বিভাগে আছে। আর কিছুই তাদের আলাদা করে না।
তৈরি করা চালু করুন। দুটি শব্দ, তাদের দুটি স্পেকট্রোগ্রাম আর হারমোনিক ও পটভূমির মধ্যে মাপা ফারাক এখানে দেখা যাবে, প্রতিটির জন্য একটি “শুনুন” বোতামের সঙ্গে।
প্রদর্শনটি যা দেখায়
হারমোনিকের একটি সারি, নগ্ন নাকি গড়ে তোলা
দুটি শব্দ একই কাজ থেকেই শুরু হয়: একই উচ্চতায়, একই বীজে, একই দৈর্ঘ্যে বাঁধা হারমোনিকের একটি সারি। কাঁচা সংস্করণ সেখানেই থেমে যায়। যত্নে বানানো সংস্করণ আরও দুটি কাজ করে: সে প্রতিটি হারমোনিকের বিস্তার তিনটি স্থির অনুনাদ দিয়ে গড়ে তোলে, যেগুলি একটি স্বরধ্বনিকে তার রং দেয়, আর সে এক আবর্তন থেকে অন্য আবর্তনে উচ্চতা ও বিস্তারের একটি সূক্ষ্ম হেরফের যোগ করে, সঙ্গে কম মাত্রার একটি শ্বাস। আর কিছুই তাদের আলাদা করে না।
রেখাচিত্রে তফাতটি শোনার আগেই দেখা যায়: কাঁচা সংস্করণ সরু আর পুরোপুরি পরিষ্কার পট্টি দেখায়, তাদের মাঝে প্রায় কোনো শক্তিই নেই। যত্নে বানানো সংস্করণ আরও চওড়া পট্টি দেখায়, তিনটি অনুনাদে জমা, আর হারমোনিকগুলির মাঝে একটু ধূসর পটভূমি নিয়ে: সেটিই শ্বাস।
একটি ফারাক, যা প্রায় কিছুতেই মুছে যায়
এই ফারাকটি, হারমোনিকের মাত্রা আর তাদের মাঝের পটভূমির মাত্রার মধ্যে, মাপা হয় ডেসিবেলে, শব্দের মাঝখান থেকে নেওয়া চৌষট্টি মিলিসেকেন্ডের একটিমাত্র ছবিতে। ডিফল্ট উচ্চতায়, অর্থাৎ একশো ত্রিশ হার্টজে, নেওয়া মানগুলি এই।
| যোগ করা লাইনের নয়েজ | কাঁচা সংস্করণ | যত্নে বানানো সংস্করণ |
|---|---|---|
| কোনোটি নয় | 49.7 | 11.7 |
| 1% | 30.3 | 11.5 |
| 2% | 24.6 | 11.3 |
| 5% | 17.1 | 10.6 |
| 10% | 11.8 | 9.8 |
| 20% | 8.4 | 8.4 |
কোনো নয়েজ যোগ না করলে কাঁচা সংস্করণের ফারাক যত্নে বানানো সংস্করণের ফারাকের প্রায় চার গুণ: শ্বাস আর অনিয়ম ছাড়া হারমোনিকের একটি নগ্ন সারি কোনো সত্যিকারের কণ্ঠ কখনও যতটা পরিষ্কার, তার চেয়েও বেশি পরিষ্কার। একটুখানি লাইনের নয়েজ যোগ করুন, আর এই বাড়তি পরিচ্ছন্নতাটি ভেঙে পড়ে: দশ শতাংশে কাঁচা সংস্করণের ফারাক আগেই চারেরও বেশি ভাগে ভাগ হয়ে গেছে। কুড়ি শতাংশে দুটি ফারাক পুরোপুরি সমান: মাপ আর কাঁচা সংস্করণ থেকে যত্নে বানানো সংস্করণকে আলাদা করতে পারে না।
যা একটি শব্দকে সত্যি হওয়ার জন্য বড় বেশি পরিষ্কার করে তোলে, ঠিক সেটিই একটি সাধারণ টেলিফোন লাইন সবার আগে মুছে দেয়।
পদ্ধতি
প্রতিটি সংস্করণ কী হিসাব করে, যিনি এই পাতা ছাড়াই তা আবার করতে চান তাঁর জন্য।
- বেছে নেওয়া উচ্চতায় বাঁধা হারমোনিকের একটি সারি তৈরি করা: প্রতিটি পূর্ণ ধাপের জন্য, সেই ধাপ গুণ মূল কম্পাঙ্কে একটি সাইন, যার বিস্তার সেই ধাপের এক ভাগ। এটিই একটি সরল করা স্বরযন্ত্রের উৎসের চেহারা, দুটি সংস্করণেই এক।
- কাঁচা সংস্করণ: সেখানেই থামা। দুই ধারে একটি খুব ছোট বিস্তারের খাপ কেবল শুরু আর শেষের খট আওয়াজটি এড়ায়: আর কিছুই যোগ করা হয় না।
- যত্নে বানানো সংস্করণ: প্রতিটি হারমোনিকের বিস্তার তিনটি স্থির অনুনাদ দিয়ে গড়ে তোলা, যেগুলি বেছে নেওয়া স্বরধ্বনির জন্য চলতি, কোনো সত্যিকারের মানুষের উপরে মাপা নয়। এক আবর্তন থেকে অন্য আবর্তনে উচ্চতা আর বিস্তার বদলে দেওয়া, বীজ দিয়ে তোলা একটি ছোট ভগ্নাংশে। একটি শ্বাস মিশিয়ে দেওয়া: সেই একই বীজে তোলা কম মাত্রার একটি নয়েজ।
- দুটি শব্দকেই একই শীর্ষ বিস্তারে ফিরিয়ে আনা, যাতে তুলনাটি কখনও নিছক আওয়াজের ফারাকের উপরে না দাঁড়ায়।
- সেটিং চাইলে, পরে দুটি শব্দেই একই লাইনের নয়েজ যোগ করা: একটি সাধারণ সঞ্চালন যেভাবেই হোক এটি যোগ করে, তৈরি করা হোক বা না হোক।
- মাপা: শব্দের কেন্দ্র থেকে 1024টি নমুনার একটি ছবি নেওয়া, ফুরিয়ে রূপান্তর দিয়ে তার স্পেকট্রাম হিসাব করা, প্রতিটি হারমোনিকের মাত্রা নেওয়া, তাদের মাঝের গড় মাত্রা নেওয়া, আর বিয়োগ করা।
প্রদর্শনে উচ্চতা বা স্বরধ্বনি বদলান, আর তার সঙ্গে অনুনাদগুলিও সরে যায়: মাপ শব্দের পিছু নেয়, সে কখনও আগে থেকে লেখা কোনো সংখ্যা নকল করে না।
এই প্রদর্শন যা করে না
- সে দেখায় যে কথার একটি শব্দ দুটি তলায় তৈরি হয়: একটি উৎস যা কাঁপে, একটি নালি যা অনুনাদ করে, আর দ্বিতীয় তলাটিই সেই সবকিছু বদলে দেয়, যা একটি শব্দকে জীবন্ত করে তোলে।
- সে হারমোনিক আর স্পেকট্রামের পটভূমির মধ্যে একটি মাপা যায় এমন ফারাক দেখায়, যা দুটি সংস্করণেই আছে।
- সে দেখায় যে কোন লাইনের নয়েজ থেকে এই ফারাক আর দুটি সংস্করণকে আলাদা করে না।
- সে কিছুই শনাক্ত করে না। এই পাতা নিজেই দুটি শব্দ তৈরি করে: সে জানে কোনটি কোনটি, সে তা আন্দাজ করে না।
- আপনি এনেছেন এমন কোনো রেকর্ডিংয়ের সে বিচার করে না, আর সে কোনো ফাইলও নেয় না। যে যন্ত্র একটি সত্যিকারের কণ্ঠের উপরে রায় দেওয়ার দাবি করে, সে মিথ্যা বলে।
- সে একটি সত্যিকারের কণ্ঠ-নকলের ব্যবস্থা নকল করে না। সেগুলি নিজেদের সেটিং একজন সত্যিকারের মানুষের রেকর্ডিং থেকে শেখে, আর এখানে তিনটি অনুনাদ হাতেই বসানো, একটি কৃত্রিম শব্দের উপরে।
গবেষণা যা মেপেছে
প্রকাশিত তিনটি ফল, এই পাতা এক মিনিটে যা অনুভব করায়, তার জায়গা ঠিক করে দেয়।
একটি কণ্ঠ নকল করতে আজ খুব কম উপাদানই লাগে: একটি গবেষণাকাজ VALL-E নামের এমন একটি ব্যবস্থার বর্ণনা দেয়, যা কখনও শোনেনি এমন একজন মানুষের কেবল তিন সেকেন্ডের একটি রেকর্ডিং থেকেই উঁচু মানের বলে বিচার করা ব্যক্তিগতকৃত কথা তৈরি করতে পারে। তিন সেকেন্ড, নিজের নাম বলার সময়ের চেয়েও কম।
যে সংকেতগুলি থেকে যায়, সেগুলি বানানো অডিওতে চেনা যায় এমন সংকেত-প্রক্রিয়ার দাগের উপরে দাঁড়ানো, আর তাদের শনাক্তকরণ নিয়ে গবেষণা নিজেদের রেফারেন্স ডেটাসেট বানাতে ঠিক এই ধরনের দাগের উপরেই নির্ভর করে। কিন্তু যে ব্যবস্থাগুলির কাজ সেগুলি ধরা, তারা সত্যিকারের শব্দের পরিবেশের সামনে এখনও যথেষ্ট মজবুত নয়, আর প্রশিক্ষণে না দেখা তৈরির পদ্ধতিতে তারা ভালোভাবে সাধারণীকরণ করতে পারে না।
এই উৎসগুলির একটিও একটি সাম্প্রতিক নকল কণ্ঠের সামনে মানুষের কান সোজা মাপে না: তাই এটি এমন একটি দাবি নয়, যা এই পাতা তাদের হয়ে করতে পারে। তারা যা বলার সুযোগ দেয়, তা আরও বিনয়ী, আর ঠিক ততটাই কাজের: একটি বানানো কণ্ঠ ধরার জন্য বিশেষভাবে প্রশিক্ষিত একটি ব্যবস্থাও একটি নতুন পদ্ধতিতে সাধারণীকরণ করতে ইতিমধ্যেই হিমশিম খায়, আর স্পেকট্রামের বাড়তি পরিচ্ছন্নতা, যখন তা থাকে, ঠিক সেই ধরনের দাগ, যা একটি সাধারণ লাইনের নয়েজ কারও কাজে লাগার আগেই মুছে দেয়, মানুষ হোক বা শনাক্তকারী।
একটি চেনা কণ্ঠ, ফোনে
2024 সালের জানুয়ারিতে একটি মার্কিন সরকারি কর্তৃপক্ষ, Federal Communications Commission, একটি সত্যিকারের প্রতারণার অভিযান নথিবদ্ধ করে আর আইনত শাস্তি দেয়: নিউ হ্যাম্পশায়ারে রাজ্যটির প্রেসিডেন্ট প্রাইমারির আগে ছড়ানো একটি স্বয়ংক্রিয় ফোনকল AI-তে নকল করা একটি কণ্ঠ বহন করছিল, যা প্রেসিডেন্ট জো বাইডেনকে নকল করছিল, আর ভোটারদের বলছিল ঘরে থাকতে আর এই প্রাইমারিটি বাদ দিয়ে “নিজেদের ভোট বাঁচিয়ে রাখতে”। শব্দের কিছুই কাউকে তার তৈরি হওয়ার কথা জানায়নি।
একটি ফোনকল আগেই শব্দ সংকুচিত করে, তাতে লাইনের নয়েজ যোগ করে, আর কানের জন্য কম্পাঙ্কের একটি সরু পট্টি ছাড়া আর কিছুই রাখে না। এই পাতা তার নিজের লাইনের নয়েজের সেটিং দিয়ে এইমাত্র ঠিক এই মিশেলটিই বানাল: যে অবস্থায় একটি সংকেতের মিলিয়ে যাওয়ার সম্ভাবনা সবচেয়ে বেশি, তা একটি সাধারণ ফোনকলেরই অবস্থা, কোনো রেকর্ডিং স্টুডিওর নয়।
যে অভ্যাসটি রেখে দিতে হবে
যে চেনা কণ্ঠ ফোনে জরুরি কিছু চায়, একটি টাকা পাঠানো, একটি কোড, একটি ঠিকানা, তার সামনে কণ্ঠটির বিচার করতে যাবেন না: এই পাতা এইমাত্র দেখাল, তা কতটা কম নির্ভরযোগ্য। ফোন রেখে দিন, আর আপনার কাছে আগেই যে নম্বরটি আছে সেখানে নিজে ফোন করুন, যে নম্বর থেকে এইমাত্র ফোন এল সেখানে নয়। কথাটি যদি সঙ্গে সঙ্গেই চালিয়ে যেতেই হয়, এমন একটি প্রশ্ন করুন যার উত্তর কোথাও প্রকাশ্যে লেখা নেই। একটি পরিবার বা একটি দল আগে থেকেই এমন একটি শব্দ ঠিক করে রাখতে পারে, যা কেবল সত্যিকারের মানুষটিই জানেন, সেই পরিস্থিতির জন্য যেখানে জরুরি অবস্থা বাকি সবটাই যাচাই করা কঠিন করে তোলে। অভ্যাসটিতে কিছুই খরচ হয় না: উপরে নথিবদ্ধ প্রতারণাটির দাম, অন্যদিকে, যাঁরা নিজের কানের উপরে ভরসা করেছিলেন, তাঁদের অনেক দিতে হয়েছে।
আরও দূর যেতে
একটি ছবির উপরে একই কাজটি আছে একটি বানানো ছবি অধ্যায়ে। উৎসেই একটি বিষয়বস্তুতে চিহ্ন বসানোর দুটি উপায় আছে জলছাপ অধ্যায়ে। যে পরিস্থিতিতে যন্ত্রটি বন্ধ হয়ে যায়, সেগুলি এক জায়গায় আছে কখন এটি ব্যবহার করবেন না-তে। সাইটের সব প্রদর্শন এক জায়গায় আছে প্রদর্শন পাতায়, আর পাঠক্রমের সূচি আছে বোঝা পাতায়।
উৎস
- WaveFake: A Data Set to Facilitate Audio Deepfake Detection Joel Frank, Lea Schönherr, 2021। প্রমাণ করে যে কৃত্রিম কণ্ঠ শনাক্ত করা নিয়ে গবেষণা তৈরি করা অডিওতে চেনা যায় এমন সংকেত-প্রক্রিয়ার দাগের উপরে দাঁড়ায়, আর সেগুলি পড়ার জন্য একটি রেফারেন্স ডেটাসেট দেয়।
- ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild Xuechen Liu, Xin Wang, Md Sahidullah, Jose Patino, Hector Delgado, Tomi Kinnunen, Massimiliano Todisco, Junichi Yamagishi, Nicholas Evans, Andreas Nautsch, Kong Aik Lee, 2021। প্রমাণ করে যে কৃত্রিম কথা শনাক্ত করার ব্যবস্থাগুলি সত্যিকারের শব্দ-পরিবেশের সামনে এখনও যথেষ্ট মজবুত নয়, আর প্রশিক্ষণে না দেখা তৈরির পদ্ধতিতে তারা ভালোভাবে সাধারণীকরণ করতে পারে না।
- FCC Makes AI-Generated Voices in Robocalls Illegal (গৃহীত ঘোষণা: FCC 24-17) Federal Communications Commission (FCC), 2024। প্রমাণ করে যে একটি মার্কিন সরকারি কর্তৃপক্ষ একটি সত্যিকারের প্রতারণার অভিযান নথিবদ্ধ করেছে আর আইনত শাস্তি দিয়েছে, যেখানে একটি নির্বাচনের আগে ভোটারদের কাছে একজন রাজনৈতিক নেতাকে নকল করা AI-তে নকল করা একটি কণ্ঠ ব্যবহার করা হয়েছিল।
- Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, Lei He, Sheng Zhao, Furu Wei, 2023। প্রমাণ করে যে VALL-E ব্যবস্থাটি কখনও শোনেনি এমন একজন মানুষের কেবল তিন সেকেন্ডের একটি রেকর্ডিং থেকেই উঁচু মানের বলে বিচার করা ব্যক্তিগতকৃত কথা তৈরি করে।