এটি ODERSA-র একটি অফিসিয়াল সাইট। কীভাবে বুঝবেন

অফিসিয়াল ডোমেইন

এই সাইটের ঠিকানা odersa.org দিয়ে শেষ হয়। সংস্থার প্রতিটি সেবা odersa.org-এর কোনো সাবডোমেইনেই থাকে, আর কোথাও নয়। আপনার ব্রাউজারের ঠিকানার ঘরে দেখানো ঠিকানা যদি odersa.org দিয়ে শেষ না হয়, তবে এই সাইট আমাদের নয়।

বিনামূল্যে, অ্যাকাউন্ট ছাড়াই

সবকিছু প্রথম মুহূর্ত থেকেই খোলা: কোনো নিবন্ধন নেই, কোনো অ্যাকাউন্ট নেই, কোনো পাসওয়ার্ড নেই, কোনো সাবস্ক্রিপশন নেই, কোনো বিজ্ঞাপন নেই। যাঁরা টাকা দেন তাঁদের জন্য আলাদা কিছু রাখা নেই, কারণ এখানে কিছুই টাকার বিনিময়ে নয়।

কোনো তথ্য সংগ্রহ নয়

এই সাইট আপনার পিছু নেয় না: কোনো ট্র্যাকার নেই, ট্র্যাকিং কুকি নেই, এই পাতাগুলোতে বসানো কোনো মাপার সরঞ্জামও নেই, আর আপনার যন্ত্রে কিছুই মাপা হয় না। আমাদের হোস্ট সমষ্টিগতভাবে অনুরোধ গোনে, উত্তর দেওয়া যেকোনো সার্ভার যেমন গোনে: একটি মোট সংখ্যা, কখনও কোনো প্রোফাইল নয়। আমাদের কথা বিশ্বাস করার দরকার নেই: আপনার ব্রাউজারের ডেভেলপার টুল খুলুন, নেটওয়ার্ক ট্যাবে যান, আর পাতাটি আবার লোড করুন। সাইট যা যা চায়, তার পুরো তালিকা আপনি দেখতে পাবেন। সবই odersa.org থেকে আসে, কিছুই অন্য কোথাও যায় না।

মুক্ত কনটেন্ট

কনটেন্ট CC BY 4.0 লাইসেন্সে প্রকাশিত। আপনি তা কপি করতে, অনুবাদ করতে, ছাপতে ও আবার বিতরণ করতে পারেন, আপনার ক্লাসের জন্যও, আপনার আপনজনের জন্যও, একটিমাত্র শর্তে: ODERSA-র নাম উল্লেখ করুন।

একটি বানানো কণ্ঠ

একটি কণ্ঠ তৈরি হয় হারমোনিক চাপিয়ে চাপিয়ে, তার পর সেগুলিকে স্বরযন্ত্রের নালির মতো অনুনাদিত করে। এই প্রদর্শন একই শব্দ দুবার বানায়, একবার মোটা দাগে আর একবার যত্ন করে, আর আপনাকে মিলিয়ে দেখতে দেয় কী শোনা যায় আর কী তার রেখাচিত্রে দেখা যায়।

একটি রেকর্ডিং স্টুডিওতে একটি ড্রাম সেটের চারপাশে স্ট্যান্ডে বসানো কয়েকটি মাইক্রোফোন
একটি কণ্ঠ রেকর্ড করতে একটা স্টুডিও লাগত। তা নকল করতে আজ কয়েক সেকেন্ডের শব্দই যথেষ্ট। আলোকচিত্র: dan paluska, ফাইলের পাতা, লাইসেন্স CC BY 2.0 (লাইসেন্সের পাঠ).
তথ্য

সবই আপনার ব্রাউজারে হিসাব হয়। দুটি শব্দই এই ডিভাইসে তৈরি হয়, তাদের স্পেকট্রাম সেখানেই হিসাব হয়, আর কোনো শব্দ কোনো সার্ভারে পাঠানোও হয় না, সেখান থেকে আসেও না। আপনার ব্রাউজারের নেটওয়ার্ক ট্যাব খুলুন আর প্রদর্শনটি নাড়াচাড়া করুন: কোনো অনুরোধই বাইরে যায় না। “শুনুন” বোতাম দুটি শব্দ বাজায়: শুনতে চাইলে আওয়াজ বাড়িয়ে নিন, নয়তো সোজা রেখাচিত্রগুলিই পড়ুন, যেগুলির বর্ণনা শব্দ ছাড়াই পড়ার মতো করে দেওয়া আছে।

একই একটি শব্দ, দুবার বানানো

এই পাতার দুটি শব্দ একই জায়গা থেকেই শুরু হয়: একই উচ্চতা, একই বীজ, এক সেকেন্ডের একই দৈর্ঘ্য। একটিকে কাঁচাই রাখা হয়, অন্যটি বাড়তি একটি প্রক্রিয়া পায়, যার বর্ণনা নিচে “পদ্ধতি” বিভাগে আছে। আর কিছুই তাদের আলাদা করে না।

একটি শব্দ বা একটি সংখ্যা। সে ঠিক করে দেয় উচ্চতার সূক্ষ্ম হেরফের, শ্বাসের দানা আর লাইনের নয়েজ: একই বীজ যে কোনো ডিভাইসেই হুবহু একই শব্দ আর একই রেখাচিত্র দেয়।
তিনটি স্থির অনুনাদ প্রতিটি স্বরধ্বনিকে তার রং দেয়। এই বাছাইয়ের সঙ্গে সেগুলি বদলায়।
130 Hz
মূল কম্পাঙ্ক, হার্টজে। একটি গম্ভীর কণ্ঠ শুরু হয় 90-র দিকে, একটি চড়া কণ্ঠ ওঠে 240-র দিকে।
0%
দুটি শব্দেই পরে যোগ করা হয়, একটি টেলিফোন লাইন বা একটি সংকুচিত ফাইল নকল করতে। এই পাতার সবচেয়ে শিক্ষণীয় সেটিং।

তৈরি করা চালু করুন। দুটি শব্দ, তাদের দুটি স্পেকট্রোগ্রাম আর হারমোনিক ও পটভূমির মধ্যে মাপা ফারাক এখানে দেখা যাবে, প্রতিটির জন্য একটি “শুনুন” বোতামের সঙ্গে।

প্রদর্শনটি যা দেখায়

হারমোনিকের একটি সারি, নগ্ন নাকি গড়ে তোলা

দুটি শব্দ একই কাজ থেকেই শুরু হয়: একই উচ্চতায়, একই বীজে, একই দৈর্ঘ্যে বাঁধা হারমোনিকের একটি সারি। কাঁচা সংস্করণ সেখানেই থেমে যায়। যত্নে বানানো সংস্করণ আরও দুটি কাজ করে: সে প্রতিটি হারমোনিকের বিস্তার তিনটি স্থির অনুনাদ দিয়ে গড়ে তোলে, যেগুলি একটি স্বরধ্বনিকে তার রং দেয়, আর সে এক আবর্তন থেকে অন্য আবর্তনে উচ্চতা ও বিস্তারের একটি সূক্ষ্ম হেরফের যোগ করে, সঙ্গে কম মাত্রার একটি শ্বাস। আর কিছুই তাদের আলাদা করে না।

রেখাচিত্রে তফাতটি শোনার আগেই দেখা যায়: কাঁচা সংস্করণ সরু আর পুরোপুরি পরিষ্কার পট্টি দেখায়, তাদের মাঝে প্রায় কোনো শক্তিই নেই। যত্নে বানানো সংস্করণ আরও চওড়া পট্টি দেখায়, তিনটি অনুনাদে জমা, আর হারমোনিকগুলির মাঝে একটু ধূসর পটভূমি নিয়ে: সেটিই শ্বাস।

একটি ফারাক, যা প্রায় কিছুতেই মুছে যায়

এই ফারাকটি, হারমোনিকের মাত্রা আর তাদের মাঝের পটভূমির মাত্রার মধ্যে, মাপা হয় ডেসিবেলে, শব্দের মাঝখান থেকে নেওয়া চৌষট্টি মিলিসেকেন্ডের একটিমাত্র ছবিতে। ডিফল্ট উচ্চতায়, অর্থাৎ একশো ত্রিশ হার্টজে, নেওয়া মানগুলি এই।

তৈরির পরে যোগ করা লাইনের নয়েজ অনুযায়ী, হারমোনিকের মাত্রা আর স্পেকট্রামের পটভূমির মাত্রার মধ্যে মাপা ফারাক, ডেসিবেলে। বীজ “ODERSA”, উচ্চতা 130 Hz, স্বরধ্বনি [a]।
যোগ করা লাইনের নয়েজকাঁচা সংস্করণযত্নে বানানো সংস্করণ
কোনোটি নয়49.711.7
1%30.311.5
2%24.611.3
5%17.110.6
10%11.89.8
20%8.48.4

কোনো নয়েজ যোগ না করলে কাঁচা সংস্করণের ফারাক যত্নে বানানো সংস্করণের ফারাকের প্রায় চার গুণ: শ্বাস আর অনিয়ম ছাড়া হারমোনিকের একটি নগ্ন সারি কোনো সত্যিকারের কণ্ঠ কখনও যতটা পরিষ্কার, তার চেয়েও বেশি পরিষ্কার। একটুখানি লাইনের নয়েজ যোগ করুন, আর এই বাড়তি পরিচ্ছন্নতাটি ভেঙে পড়ে: দশ শতাংশে কাঁচা সংস্করণের ফারাক আগেই চারেরও বেশি ভাগে ভাগ হয়ে গেছে। কুড়ি শতাংশে দুটি ফারাক পুরোপুরি সমান: মাপ আর কাঁচা সংস্করণ থেকে যত্নে বানানো সংস্করণকে আলাদা করতে পারে না।

যা একটি শব্দকে সত্যি হওয়ার জন্য বড় বেশি পরিষ্কার করে তোলে, ঠিক সেটিই একটি সাধারণ টেলিফোন লাইন সবার আগে মুছে দেয়।

পদ্ধতি

প্রতিটি সংস্করণ কী হিসাব করে, যিনি এই পাতা ছাড়াই তা আবার করতে চান তাঁর জন্য।

  1. বেছে নেওয়া উচ্চতায় বাঁধা হারমোনিকের একটি সারি তৈরি করা: প্রতিটি পূর্ণ ধাপের জন্য, সেই ধাপ গুণ মূল কম্পাঙ্কে একটি সাইন, যার বিস্তার সেই ধাপের এক ভাগ। এটিই একটি সরল করা স্বরযন্ত্রের উৎসের চেহারা, দুটি সংস্করণেই এক।
  2. কাঁচা সংস্করণ: সেখানেই থামা। দুই ধারে একটি খুব ছোট বিস্তারের খাপ কেবল শুরু আর শেষের খট আওয়াজটি এড়ায়: আর কিছুই যোগ করা হয় না।
  3. যত্নে বানানো সংস্করণ: প্রতিটি হারমোনিকের বিস্তার তিনটি স্থির অনুনাদ দিয়ে গড়ে তোলা, যেগুলি বেছে নেওয়া স্বরধ্বনির জন্য চলতি, কোনো সত্যিকারের মানুষের উপরে মাপা নয়। এক আবর্তন থেকে অন্য আবর্তনে উচ্চতা আর বিস্তার বদলে দেওয়া, বীজ দিয়ে তোলা একটি ছোট ভগ্নাংশে। একটি শ্বাস মিশিয়ে দেওয়া: সেই একই বীজে তোলা কম মাত্রার একটি নয়েজ।
  4. দুটি শব্দকেই একই শীর্ষ বিস্তারে ফিরিয়ে আনা, যাতে তুলনাটি কখনও নিছক আওয়াজের ফারাকের উপরে না দাঁড়ায়।
  5. সেটিং চাইলে, পরে দুটি শব্দেই একই লাইনের নয়েজ যোগ করা: একটি সাধারণ সঞ্চালন যেভাবেই হোক এটি যোগ করে, তৈরি করা হোক বা না হোক।
  6. মাপা: শব্দের কেন্দ্র থেকে 1024টি নমুনার একটি ছবি নেওয়া, ফুরিয়ে রূপান্তর দিয়ে তার স্পেকট্রাম হিসাব করা, প্রতিটি হারমোনিকের মাত্রা নেওয়া, তাদের মাঝের গড় মাত্রা নেওয়া, আর বিয়োগ করা।

প্রদর্শনে উচ্চতা বা স্বরধ্বনি বদলান, আর তার সঙ্গে অনুনাদগুলিও সরে যায়: মাপ শব্দের পিছু নেয়, সে কখনও আগে থেকে লেখা কোনো সংখ্যা নকল করে না।

এই প্রদর্শন যা করে না

  • সে দেখায় যে কথার একটি শব্দ দুটি তলায় তৈরি হয়: একটি উৎস যা কাঁপে, একটি নালি যা অনুনাদ করে, আর দ্বিতীয় তলাটিই সেই সবকিছু বদলে দেয়, যা একটি শব্দকে জীবন্ত করে তোলে।
  • সে হারমোনিক আর স্পেকট্রামের পটভূমির মধ্যে একটি মাপা যায় এমন ফারাক দেখায়, যা দুটি সংস্করণেই আছে।
  • সে দেখায় যে কোন লাইনের নয়েজ থেকে এই ফারাক আর দুটি সংস্করণকে আলাদা করে না।
  • সে কিছুই শনাক্ত করে না। এই পাতা নিজেই দুটি শব্দ তৈরি করে: সে জানে কোনটি কোনটি, সে তা আন্দাজ করে না।
  • আপনি এনেছেন এমন কোনো রেকর্ডিংয়ের সে বিচার করে না, আর সে কোনো ফাইলও নেয় না। যে যন্ত্র একটি সত্যিকারের কণ্ঠের উপরে রায় দেওয়ার দাবি করে, সে মিথ্যা বলে।
  • সে একটি সত্যিকারের কণ্ঠ-নকলের ব্যবস্থা নকল করে না। সেগুলি নিজেদের সেটিং একজন সত্যিকারের মানুষের রেকর্ডিং থেকে শেখে, আর এখানে তিনটি অনুনাদ হাতেই বসানো, একটি কৃত্রিম শব্দের উপরে।

গবেষণা যা মেপেছে

প্রকাশিত তিনটি ফল, এই পাতা এক মিনিটে যা অনুভব করায়, তার জায়গা ঠিক করে দেয়।

একটি কণ্ঠ নকল করতে আজ খুব কম উপাদানই লাগে: একটি গবেষণাকাজ VALL-E নামের এমন একটি ব্যবস্থার বর্ণনা দেয়, যা কখনও শোনেনি এমন একজন মানুষের কেবল তিন সেকেন্ডের একটি রেকর্ডিং থেকেই উঁচু মানের বলে বিচার করা ব্যক্তিগতকৃত কথা তৈরি করতে পারে। তিন সেকেন্ড, নিজের নাম বলার সময়ের চেয়েও কম।

যে সংকেতগুলি থেকে যায়, সেগুলি বানানো অডিওতে চেনা যায় এমন সংকেত-প্রক্রিয়ার দাগের উপরে দাঁড়ানো, আর তাদের শনাক্তকরণ নিয়ে গবেষণা নিজেদের রেফারেন্স ডেটাসেট বানাতে ঠিক এই ধরনের দাগের উপরেই নির্ভর করে। কিন্তু যে ব্যবস্থাগুলির কাজ সেগুলি ধরা, তারা সত্যিকারের শব্দের পরিবেশের সামনে এখনও যথেষ্ট মজবুত নয়, আর প্রশিক্ষণে না দেখা তৈরির পদ্ধতিতে তারা ভালোভাবে সাধারণীকরণ করতে পারে না।

এই উৎসগুলির একটিও একটি সাম্প্রতিক নকল কণ্ঠের সামনে মানুষের কান সোজা মাপে না: তাই এটি এমন একটি দাবি নয়, যা এই পাতা তাদের হয়ে করতে পারে। তারা যা বলার সুযোগ দেয়, তা আরও বিনয়ী, আর ঠিক ততটাই কাজের: একটি বানানো কণ্ঠ ধরার জন্য বিশেষভাবে প্রশিক্ষিত একটি ব্যবস্থাও একটি নতুন পদ্ধতিতে সাধারণীকরণ করতে ইতিমধ্যেই হিমশিম খায়, আর স্পেকট্রামের বাড়তি পরিচ্ছন্নতা, যখন তা থাকে, ঠিক সেই ধরনের দাগ, যা একটি সাধারণ লাইনের নয়েজ কারও কাজে লাগার আগেই মুছে দেয়, মানুষ হোক বা শনাক্তকারী।

একটি চেনা কণ্ঠ, ফোনে

2024 সালের জানুয়ারিতে একটি মার্কিন সরকারি কর্তৃপক্ষ, Federal Communications Commission, একটি সত্যিকারের প্রতারণার অভিযান নথিবদ্ধ করে আর আইনত শাস্তি দেয়: নিউ হ্যাম্পশায়ারে রাজ্যটির প্রেসিডেন্ট প্রাইমারির আগে ছড়ানো একটি স্বয়ংক্রিয় ফোনকল AI-তে নকল করা একটি কণ্ঠ বহন করছিল, যা প্রেসিডেন্ট জো বাইডেনকে নকল করছিল, আর ভোটারদের বলছিল ঘরে থাকতে আর এই প্রাইমারিটি বাদ দিয়ে “নিজেদের ভোট বাঁচিয়ে রাখতে”। শব্দের কিছুই কাউকে তার তৈরি হওয়ার কথা জানায়নি।

একটি ফোনকল আগেই শব্দ সংকুচিত করে, তাতে লাইনের নয়েজ যোগ করে, আর কানের জন্য কম্পাঙ্কের একটি সরু পট্টি ছাড়া আর কিছুই রাখে না। এই পাতা তার নিজের লাইনের নয়েজের সেটিং দিয়ে এইমাত্র ঠিক এই মিশেলটিই বানাল: যে অবস্থায় একটি সংকেতের মিলিয়ে যাওয়ার সম্ভাবনা সবচেয়ে বেশি, তা একটি সাধারণ ফোনকলেরই অবস্থা, কোনো রেকর্ডিং স্টুডিওর নয়।

যে অভ্যাসটি রেখে দিতে হবে

যে চেনা কণ্ঠ ফোনে জরুরি কিছু চায়, একটি টাকা পাঠানো, একটি কোড, একটি ঠিকানা, তার সামনে কণ্ঠটির বিচার করতে যাবেন না: এই পাতা এইমাত্র দেখাল, তা কতটা কম নির্ভরযোগ্য। ফোন রেখে দিন, আর আপনার কাছে আগেই যে নম্বরটি আছে সেখানে নিজে ফোন করুন, যে নম্বর থেকে এইমাত্র ফোন এল সেখানে নয়। কথাটি যদি সঙ্গে সঙ্গেই চালিয়ে যেতেই হয়, এমন একটি প্রশ্ন করুন যার উত্তর কোথাও প্রকাশ্যে লেখা নেই। একটি পরিবার বা একটি দল আগে থেকেই এমন একটি শব্দ ঠিক করে রাখতে পারে, যা কেবল সত্যিকারের মানুষটিই জানেন, সেই পরিস্থিতির জন্য যেখানে জরুরি অবস্থা বাকি সবটাই যাচাই করা কঠিন করে তোলে। অভ্যাসটিতে কিছুই খরচ হয় না: উপরে নথিবদ্ধ প্রতারণাটির দাম, অন্যদিকে, যাঁরা নিজের কানের উপরে ভরসা করেছিলেন, তাঁদের অনেক দিতে হয়েছে।

আরও দূর যেতে

একটি ছবির উপরে একই কাজটি আছে একটি বানানো ছবি অধ্যায়ে। উৎসেই একটি বিষয়বস্তুতে চিহ্ন বসানোর দুটি উপায় আছে জলছাপ অধ্যায়ে। যে পরিস্থিতিতে যন্ত্রটি বন্ধ হয়ে যায়, সেগুলি এক জায়গায় আছে কখন এটি ব্যবহার করবেন না-তে। সাইটের সব প্রদর্শন এক জায়গায় আছে প্রদর্শন পাতায়, আর পাঠক্রমের সূচি আছে বোঝা পাতায়।

উৎস