صوت مصنوع
الصوت يُصنَع بتركيب توافقيات، ثم بجعلها ترنّ كأنها مجرًى صوتي. وهذا العرض يصنع الصوت نفسه مرّتين، مرة بخشونة ومرة بإتقان، ويتيح لك مقارنة ما يُسمَع وما يُرى على رسمه.
كل شيء يُحسَب في متصفّحك. فالصوتان يُصنَعان على هذا الجهاز، وطيفهما يُحسَب فيه، ولا صوت يُرسَل ولا يُستقبَل من أي خادم. افتح تبويب الشبكة في متصفّحك وجرّب العرض: لا طلب واحدًا يخرج. وزرّا «استمع» يُصدِران صوتًا: ارفع الصوت إن أردت سماعه، أو اقرأ الرسوم مباشرةً، فهي مشروحة لتُقرأ دونه.
صوت واحد، مصنوع مرّتين
الصوتان في هذه الصفحة ينطلقان من نقطة البداية نفسها: الدرجة نفسها، والبذرة نفسها، والمدة نفسها وهي ثانية واحدة. أحدهما يُترَك خامًّا، والآخر يتلقّى معالجة إضافية، موصوفة أدناه في قسم «المنهج». ولا شيء آخر يفرّق بينهما.
أطلق الصناعة. وسيظهر هنا الصوتان، ورسمهما الطيفي، والفارق المقيس بين التوافقيات والخلفية، مع زرّ «استمع» لكل واحد.
ما يُظهره العرض
قطار توافقيات، عاريًا أو مُشكَّلًا
الصوتان ينطلقان من الخطوة نفسها: سلسلة توافقيات مضبوطة على الدرجة نفسها، والبذرة نفسها، والمدة نفسها. والنسخة الخامّة تتوقّف هناك. أما النسخة المتقنة فتفعل شيئين إضافيين: تُشكِّل مقدار كل توافقية بثلاثة رنينات ثابتة، تعطي لونها لحركة، وتضيف تغيّرًا دقيقًا في الدرجة والمقدار من دورة إلى أخرى، مع نفَس منخفض المستوى. ولا شيء آخر يفرّق بينهما.
وعلى الرسم، يُرى الفرق قبل أن يُسمَع: فالنسخة الخامّة تُظهر حزمًا رقيقة وحادّة تمامًا، بلا طاقة تقريبًا بينها. والنسخة المتقنة تُظهر حزمًا أوسع، مركّزة عند الرنينات الثلاثة، مع خلفية مُشوبة بالرمادي قليلًا بين التوافقيات: وهذا هو النفَس.
فارق يُمحى بلا شيء تقريبًا
وهذا الفارق، بين مستوى التوافقيات ومستوى الخلفية بينها، يُقاس بالديسيبل على صورة واحدة مدتها أربع وستون ميلي ثانية مأخوذة من وسط الصوت. والقيم المرصودة عند الدرجة الافتراضية، مئة وثلاثين هرتز، هي هذه.
| تشويش الخطّ المُضاف | النسخة الخامّة | النسخة المتقنة |
|---|---|---|
| لا شيء | 49.7 | 11.7 |
| 1% | 30.3 | 11.5 |
| 2% | 24.6 | 11.3 |
| 5% | 17.1 | 10.6 |
| 10% | 11.8 | 9.8 |
| 20% | 8.4 | 8.4 |
وبلا أي تشويش مُضاف، يكون فارق النسخة الخامّة أكبر بنحو أربع مرات من فارق النسخة المتقنة: فقطار توافقيات عارٍ، بلا نفَس ولا لانتظام، أحدّ من أي صوت بشري حقيقي على الإطلاق. أضِف أدنى تشويش خطّ، فينهار هذا الإفراط في الحدّة: فعند عشرة في المئة، يكون فارق النسخة الخامّة قد انقسم على أكثر من أربعة. وعند عشرين في المئة، يتساوى الفارقان تمامًا: فلا يميّز القياس النسخة الخامّة من النسخة المتقنة.
ما يجعل صوتًا أحدّ من أن يكون حقيقيًا هو بالضبط ما يمحوه خطّ هاتفي عادي أولًا.
المنهج
ما تحسبه كل نسخة، لمن يريد إعادته بلا هذه الصفحة.
- صناعة قطار توافقيات مضبوط على الدرجة المختارة: لكل رتبة صحيحة، جيبٌ عند هذه الرتبة مضروبةً في التردّد الأساسي، بمقدار واحد على هذه الرتبة. وهذه صورة مصدر حنجري مبسَّط، مشتركة بين النسختين.
- النسخة الخامّة: التوقّف هناك. وغلافُ مقدارٍ قصير جدًا عند الحدّين يجنّب فقط نقرة البداية والنهاية: ولا شيء آخر يُضاف.
- النسخة المتقنة: تشكيل مقدار كل توافقية بثلاثة رنينات ثابتة، معتادة للحركة المختارة، لا مقيسة على شخص حقيقي. وتغيير الدرجة والمقدار من دورة إلى أخرى، بجزء صغير يسحبه المولّد بالبذرة. ومزج نفَس: تشويش منخفض المستوى، مسحوب بالبذرة نفسها.
- إرجاع الصوتين إلى المقدار الأقصى نفسه، حتى لا تقوم المقارنة أبدًا على مجرّد فارق في مستوى الصوت.
- وإن طلب الضبط ذلك، إضافة تشويش الخطّ نفسه بعد الصناعة إلى الصوتين: فهذا ما يضيفه النقل العادي على أي حال، كانت هناك صناعة أو لا.
- القياس: تُؤخَذ صورة من 1024 عيّنة في وسط الصوت، ويُحسَب طيفها بتحويل فورييه، ويُرصَد مستوى كل توافقية، ويُرصَد المستوى المتوسّط بينها، ثم يُطرَح أحدهما من الآخر.
غيّر الدرجة أو الحركة في العرض، فتتحرّك الرنينات معهما: فالقياس يتبع الصوت، ولا ينسخ أبدًا رقمًا مكتوبًا سلفًا.
ما لا يفعله هذا العرض
- يُظهر أن صوت الكلام يُصنَع بطابقين: مصدرٌ يهتزّ، ومجرًى يرنّ، وأن الطابق الثاني يغيّر كل ما يجعل الصوت حيًّا.
- يُظهر فارقًا قابلًا للقياس بين التوافقيات وخلفية الطيف، موجودًا في النسختين.
- يُظهر عند أي تشويش خطّ يتوقّف هذا الفارق عن التمييز بين النسختين.
- لا يكشف شيئًا. فهذه الصفحة تصنع الصوتين بنفسها: وهي تعرف أيّهما أيّهما، ولا تحدسه.
- لا يحكم على أي تسجيل تأتي به إليه، ولا يقبل أي ملفّ. والأداة التي تدّعي الحكم على صوت حقيقي تكذب.
- لا يستنسخ نظام استنساخ صوتي حقيقيًا. فهذه الأنظمة تتعلّم إعداداتها من تسجيل شخص حقيقي، بينما تُوضَع الرنينات الثلاثة هنا باليد، على صوت اصطناعي.
ما قاسه البحث العلمي
ثلاث نتائج منشورة تحدّد موقع ما تجعله هذه الصفحة ملموسًا في دقيقة.
استنساخ صوت يطلب اليوم مادة قليلة جدًا: فعمل بحثي يصف نظامًا، اسمه VALL-E، قادرًا على تركيب كلام مخصَّص حُكِم عليه بأنه عالي الجودة من تسجيل مدته ثلاث ثوان فقط لشخص لم يسمعه أبدًا. وثلاث ثوان أقلّ من وقت نطق المرء لاسمه.
والمؤشّرات الباقية تعود إلى آثار معالجة إشارة قابلة للتعريف في الصوت المصنوع، والبحث في كشفها يستند بالضبط إلى هذا النوع من الأثر لبناء مجموعات بياناته المرجعية. لكن الأنظمة المكلَّفة برصدها ما زالت تفتقر إلى المتانة أمام الظروف الصوتية الحقيقية، وتعمّم بصورة سيّئة على طرق توليد لم ترها في التدريب.
ولا واحد من هذه المصادر يقيس مباشرةً الأذن البشرية أمام صوت مستنسَخ حديث: فهذا ليس إذن تأكيدًا تستطيع هذه الصفحة أن تقوله بدلًا منها. وما تسمح بقوله أكثر تواضعًا، وهو مفيد بالقدر نفسه: فالنظام المدرَّب خصيصًا لرصد صوت مصنوع يشقّ عليه سلفًا التعميم على طريقة جديدة، والإفراط في الحدّة الطيفية، حين يوجد، هو بالضبط نوع الأثر الذي يمحوه تشويش خطّ عادي قبل أن يخدم أي أحد، إنسانًا كان أو كاشفًا.
صوت معروف، في الهاتف
في يناير 2024، وثّقت سلطة عامة أمريكية، وهي لجنة الاتصالات الفيدرالية (Federal Communications Commission)، وعاقبت قانونيًا حملة احتيال حقيقية: فمكالمة آلية، بُثَّت في نيوهامبشير قبل الانتخابات التمهيدية الرئاسية في الولاية، حملت صوتًا مستنسَخًا بالذكاء الاصطناعي يقلّد الرئيس جو بايدن، وطلبت من الناخبين البقاء في بيوتهم و«الاحتفاظ بصوتهم» بتخطّي هذه الانتخابات التمهيدية. ولا شيء في الصوت كان ينبّه أحدًا إلى صناعته.
والمكالمة الهاتفية تضغط الصوت أصلًا، وتضيف إليه تشويش خطّ، ولا تترك للأذن غير حزمة ترددات ضيّقة. وهذه بالضبط هي التركيبة التي صنعتها هذه الصفحة للتوّ بضبط تشويش الخطّ فيها: فالظروف التي يكون فيها للمؤشّر أوفر حظّ في الزوال هي ظروف مكالمة عادية، لا ظروف استوديو تسجيل.
الخطوة التي تُحفَظ
أمام صوت معروف يطلب، بالهاتف، شيئًا عاجلًا، تحويلًا ماليًا أو رمزًا أو عنوانًا، لا تحاول الحكم على الصوت: فهذه الصفحة أظهرت للتوّ كم أن ذلك قليل الموثوقية. أغلِق الخطّ، واتّصل أنت على الرقم الذي لديك سلفًا، لا على الذي اتّصل للتوّ. وإن كان لا بدّ أن تستمرّ المكالمة في الحال، اطرح سؤالًا لا يكون جوابه مكتوبًا في أي مكان عامّ. ويمكن لعائلة أو لفريق أن يتّفقوا سلفًا على كلمة لا يعرفها إلا الشخص الحقيقي، للأوضاع التي تجعل فيها العجالة كل شيء آخر صعب التحقّق. والخطوة لا تكلّف شيئًا: أما الاحتيال الموثَّق أعلاه فقد كلّف كثيرًا من ائتمن أذنه.
للمضيّ أبعد
العمل نفسه على صورة في فصل صورة مصنوعة. والطريقتان لوسم محتوى عند المصدر في فصل العلامات المائية. والأوضاع التي تُغلَق فيها الأداة مجتمعة في متى لا تستخدمه. وكل عروض الموقع التفاعلية مجتمعة في صفحة العروض التفاعلية، وفهرس الدورة في صفحة الفهم.
المصادر
- WaveFake: A Data Set to Facilitate Audio Deepfake Detection Joel Frank، Lea Schönherr، 2021. يُثبِت أن البحث في كشف الصوت الاصطناعي يستند إلى آثار معالجة إشارة قابلة للتعريف في الصوت المولَّد، ويقدّم مجموعة بيانات مرجعية لدراستها.
- ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild Xuechen Liu، Xin Wang، Md Sahidullah، Jose Patino، Hector Delgado، Tomi Kinnunen، Massimiliano Todisco، Junichi Yamagishi، Nicholas Evans، Andreas Nautsch، Kong Aik Lee، 2021. يُثبِت أن أنظمة كشف الكلام الاصطناعي ما زالت تفتقر إلى المتانة أمام البيئات الصوتية الحقيقية، وتعمّم بصورة سيّئة على طرق توليد لم ترها في التدريب.
- FCC Makes AI-Generated Voices in Robocalls Illegal (الإعلان المعتمَد: FCC 24-17) لجنة الاتصالات الفيدرالية الأمريكية (FCC)، 2024. يُثبِت أن سلطة عامة أمريكية وثّقت وعاقبت قانونيًا حملة احتيال حقيقية استخدمت صوتًا مستنسَخًا بالذكاء الاصطناعي يقلّد مسؤولًا سياسيًا لدى ناخبين قبل انتخابات.
- Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers Chengyi Wang، Sanyuan Chen، Yu Wu، Ziqiang Zhang، Long Zhou، Shujie Liu، Zhuo Chen، Yanqing Liu، Huaming Wang، Jinyu Li، Lei He، Sheng Zhao، Furu Wei، 2023. يُثبِت أن نظام VALL-E يركّب كلامًا مخصَّصًا حُكِم عليه بأنه عالي الجودة من تسجيل مدته ثلاث ثوان فقط لشخص لم يسمعه أبدًا.