هذا موقع رسمي تابع لـ ODERSA. إليكم كيف تتأكّدون

النطاق الرسمي

عنوان هذا الموقع ينتهي بـ odersa.org. كل خدمة من خدمات الجمعية توجد على نطاق فرعي من odersa.org، ولا في أي مكان آخر. وإذا كان العنوان الظاهر في شريط متصفّحكم لا ينتهي بـ odersa.org، فهذا الموقع ليس موقعنا.

مجاني، وبلا حساب

كل شيء متاح من اللحظة الأولى: لا تسجيل، ولا حساب، ولا كلمة مرور، ولا اشتراك، ولا إعلانات. ولا شيء محجوز لمن يدفع، لأن لا شيء هنا يُدفع.

لا جمع لأي بيانات

هذا الموقع لا يتعقّبكم: لا أدوات تتبّع، ولا ملفات تعريف ارتباط للتتبّع، ولا أي أداة قياس مدمجة في هذه الصفحات، ولا شيء يُقاس على جهازكم. مُضيفنا يَعُدّ الطلبات بشكل إجمالي، كما يفعل أي خادم يستجيب: مجموع، لا ملف شخصي. ولا حاجة أن تصدّقونا: افتحوا أدوات المطوّر في متصفّحكم، تبويب الشبكة، وأعيدوا تحميل الصفحة. سترون القائمة الكاملة لما يطلبه الموقع. كل شيء يأتي من odersa.org، ولا شيء يذهب إلى مكان آخر.

محتوى حر

المحتوى منشور برخصة CC BY 4.0. يمكنكم نسخه وترجمته وطبعه وإعادة توزيعه، في دروسكم كما بين من حولكم، بشرط واحد: ذكر ODERSA.

صوت مصنوع

الصوت يُصنَع بتركيب توافقيات، ثم بجعلها ترنّ كأنها مجرًى صوتي. وهذا العرض يصنع الصوت نفسه مرّتين، مرة بخشونة ومرة بإتقان، ويتيح لك مقارنة ما يُسمَع وما يُرى على رسمه.

عدة ميكروفونات مثبَّتة على حوامل حول طقم طبول، في استوديو تسجيل
تسجيل صوت كان يطلب استوديو. أما نسخه فيطلب اليوم ثوانٍ قليلة من الصوت. الصورة: dan paluska, صفحة الملف، الترخيص CC BY 2.0 (نصّ الترخيص).
معلومة

كل شيء يُحسَب في متصفّحك. فالصوتان يُصنَعان على هذا الجهاز، وطيفهما يُحسَب فيه، ولا صوت يُرسَل ولا يُستقبَل من أي خادم. افتح تبويب الشبكة في متصفّحك وجرّب العرض: لا طلب واحدًا يخرج. وزرّا «استمع» يُصدِران صوتًا: ارفع الصوت إن أردت سماعه، أو اقرأ الرسوم مباشرةً، فهي مشروحة لتُقرأ دونه.

صوت واحد، مصنوع مرّتين

الصوتان في هذه الصفحة ينطلقان من نقطة البداية نفسها: الدرجة نفسها، والبذرة نفسها، والمدة نفسها وهي ثانية واحدة. أحدهما يُترَك خامًّا، والآخر يتلقّى معالجة إضافية، موصوفة أدناه في قسم «المنهج». ولا شيء آخر يفرّق بينهما.

كلمة أو رقم. وهي تحدّد التغيّر الدقيق في الدرجة، وحبيبة النفَس، وتشويش الخطّ: فالبذرة نفسها تعطي الصوت نفسه والرسم نفسه بالضبط، على أي جهاز.
ثلاثة رنينات ثابتة تعطي كل حركة لونها. وهي تتغيّر بهذا الاختيار.
130 هرتز
التردّد الأساسي، بالهرتز. فالصوت الغليظ يبدأ نحو 90، والصوت الحادّ يصعد نحو 240.
0‎%‎
يُضاف بعد الصناعة إلى الصوتين، لمحاكاة خطّ هاتفي أو ملفّ مضغوط. وهو أكثر ضبط في الصفحة إفادةً.

أطلق الصناعة. وسيظهر هنا الصوتان، ورسمهما الطيفي، والفارق المقيس بين التوافقيات والخلفية، مع زرّ «استمع» لكل واحد.

ما يُظهره العرض

قطار توافقيات، عاريًا أو مُشكَّلًا

الصوتان ينطلقان من الخطوة نفسها: سلسلة توافقيات مضبوطة على الدرجة نفسها، والبذرة نفسها، والمدة نفسها. والنسخة الخامّة تتوقّف هناك. أما النسخة المتقنة فتفعل شيئين إضافيين: تُشكِّل مقدار كل توافقية بثلاثة رنينات ثابتة، تعطي لونها لحركة، وتضيف تغيّرًا دقيقًا في الدرجة والمقدار من دورة إلى أخرى، مع نفَس منخفض المستوى. ولا شيء آخر يفرّق بينهما.

وعلى الرسم، يُرى الفرق قبل أن يُسمَع: فالنسخة الخامّة تُظهر حزمًا رقيقة وحادّة تمامًا، بلا طاقة تقريبًا بينها. والنسخة المتقنة تُظهر حزمًا أوسع، مركّزة عند الرنينات الثلاثة، مع خلفية مُشوبة بالرمادي قليلًا بين التوافقيات: وهذا هو النفَس.

فارق يُمحى بلا شيء تقريبًا

وهذا الفارق، بين مستوى التوافقيات ومستوى الخلفية بينها، يُقاس بالديسيبل على صورة واحدة مدتها أربع وستون ميلي ثانية مأخوذة من وسط الصوت. والقيم المرصودة عند الدرجة الافتراضية، مئة وثلاثين هرتز، هي هذه.

الفارق المقيس بين مستوى التوافقيات ومستوى خلفية الطيف، بالديسيبل، حسب تشويش الخطّ المُضاف بعد الصناعة. البذرة «ODERSA»، والدرجة 130 هرتز، والحركة [a].
تشويش الخطّ المُضافالنسخة الخامّةالنسخة المتقنة
لا شيء49.711.7
1‎%‎30.311.5
2‎%‎24.611.3
5‎%‎17.110.6
10‎%‎11.89.8
20‎%‎8.48.4

وبلا أي تشويش مُضاف، يكون فارق النسخة الخامّة أكبر بنحو أربع مرات من فارق النسخة المتقنة: فقطار توافقيات عارٍ، بلا نفَس ولا لانتظام، أحدّ من أي صوت بشري حقيقي على الإطلاق. أضِف أدنى تشويش خطّ، فينهار هذا الإفراط في الحدّة: فعند عشرة في المئة، يكون فارق النسخة الخامّة قد انقسم على أكثر من أربعة. وعند عشرين في المئة، يتساوى الفارقان تمامًا: فلا يميّز القياس النسخة الخامّة من النسخة المتقنة.

ما يجعل صوتًا أحدّ من أن يكون حقيقيًا هو بالضبط ما يمحوه خطّ هاتفي عادي أولًا.

المنهج

ما تحسبه كل نسخة، لمن يريد إعادته بلا هذه الصفحة.

  1. صناعة قطار توافقيات مضبوط على الدرجة المختارة: لكل رتبة صحيحة، جيبٌ عند هذه الرتبة مضروبةً في التردّد الأساسي، بمقدار واحد على هذه الرتبة. وهذه صورة مصدر حنجري مبسَّط، مشتركة بين النسختين.
  2. النسخة الخامّة: التوقّف هناك. وغلافُ مقدارٍ قصير جدًا عند الحدّين يجنّب فقط نقرة البداية والنهاية: ولا شيء آخر يُضاف.
  3. النسخة المتقنة: تشكيل مقدار كل توافقية بثلاثة رنينات ثابتة، معتادة للحركة المختارة، لا مقيسة على شخص حقيقي. وتغيير الدرجة والمقدار من دورة إلى أخرى، بجزء صغير يسحبه المولّد بالبذرة. ومزج نفَس: تشويش منخفض المستوى، مسحوب بالبذرة نفسها.
  4. إرجاع الصوتين إلى المقدار الأقصى نفسه، حتى لا تقوم المقارنة أبدًا على مجرّد فارق في مستوى الصوت.
  5. وإن طلب الضبط ذلك، إضافة تشويش الخطّ نفسه بعد الصناعة إلى الصوتين: فهذا ما يضيفه النقل العادي على أي حال، كانت هناك صناعة أو لا.
  6. القياس: تُؤخَذ صورة من 1024 عيّنة في وسط الصوت، ويُحسَب طيفها بتحويل فورييه، ويُرصَد مستوى كل توافقية، ويُرصَد المستوى المتوسّط بينها، ثم يُطرَح أحدهما من الآخر.

غيّر الدرجة أو الحركة في العرض، فتتحرّك الرنينات معهما: فالقياس يتبع الصوت، ولا ينسخ أبدًا رقمًا مكتوبًا سلفًا.

ما لا يفعله هذا العرض

  • يُظهر أن صوت الكلام يُصنَع بطابقين: مصدرٌ يهتزّ، ومجرًى يرنّ، وأن الطابق الثاني يغيّر كل ما يجعل الصوت حيًّا.
  • يُظهر فارقًا قابلًا للقياس بين التوافقيات وخلفية الطيف، موجودًا في النسختين.
  • يُظهر عند أي تشويش خطّ يتوقّف هذا الفارق عن التمييز بين النسختين.
  • لا يكشف شيئًا. فهذه الصفحة تصنع الصوتين بنفسها: وهي تعرف أيّهما أيّهما، ولا تحدسه.
  • لا يحكم على أي تسجيل تأتي به إليه، ولا يقبل أي ملفّ. والأداة التي تدّعي الحكم على صوت حقيقي تكذب.
  • لا يستنسخ نظام استنساخ صوتي حقيقيًا. فهذه الأنظمة تتعلّم إعداداتها من تسجيل شخص حقيقي، بينما تُوضَع الرنينات الثلاثة هنا باليد، على صوت اصطناعي.

ما قاسه البحث العلمي

ثلاث نتائج منشورة تحدّد موقع ما تجعله هذه الصفحة ملموسًا في دقيقة.

استنساخ صوت يطلب اليوم مادة قليلة جدًا: فعمل بحثي يصف نظامًا، اسمه VALL-E، قادرًا على تركيب كلام مخصَّص حُكِم عليه بأنه عالي الجودة من تسجيل مدته ثلاث ثوان فقط لشخص لم يسمعه أبدًا. وثلاث ثوان أقلّ من وقت نطق المرء لاسمه.

والمؤشّرات الباقية تعود إلى آثار معالجة إشارة قابلة للتعريف في الصوت المصنوع، والبحث في كشفها يستند بالضبط إلى هذا النوع من الأثر لبناء مجموعات بياناته المرجعية. لكن الأنظمة المكلَّفة برصدها ما زالت تفتقر إلى المتانة أمام الظروف الصوتية الحقيقية، وتعمّم بصورة سيّئة على طرق توليد لم ترها في التدريب.

ولا واحد من هذه المصادر يقيس مباشرةً الأذن البشرية أمام صوت مستنسَخ حديث: فهذا ليس إذن تأكيدًا تستطيع هذه الصفحة أن تقوله بدلًا منها. وما تسمح بقوله أكثر تواضعًا، وهو مفيد بالقدر نفسه: فالنظام المدرَّب خصيصًا لرصد صوت مصنوع يشقّ عليه سلفًا التعميم على طريقة جديدة، والإفراط في الحدّة الطيفية، حين يوجد، هو بالضبط نوع الأثر الذي يمحوه تشويش خطّ عادي قبل أن يخدم أي أحد، إنسانًا كان أو كاشفًا.

صوت معروف، في الهاتف

في يناير 2024، وثّقت سلطة عامة أمريكية، وهي لجنة الاتصالات الفيدرالية (Federal Communications Commission)، وعاقبت قانونيًا حملة احتيال حقيقية: فمكالمة آلية، بُثَّت في نيوهامبشير قبل الانتخابات التمهيدية الرئاسية في الولاية، حملت صوتًا مستنسَخًا بالذكاء الاصطناعي يقلّد الرئيس جو بايدن، وطلبت من الناخبين البقاء في بيوتهم و«الاحتفاظ بصوتهم» بتخطّي هذه الانتخابات التمهيدية. ولا شيء في الصوت كان ينبّه أحدًا إلى صناعته.

والمكالمة الهاتفية تضغط الصوت أصلًا، وتضيف إليه تشويش خطّ، ولا تترك للأذن غير حزمة ترددات ضيّقة. وهذه بالضبط هي التركيبة التي صنعتها هذه الصفحة للتوّ بضبط تشويش الخطّ فيها: فالظروف التي يكون فيها للمؤشّر أوفر حظّ في الزوال هي ظروف مكالمة عادية، لا ظروف استوديو تسجيل.

الخطوة التي تُحفَظ

أمام صوت معروف يطلب، بالهاتف، شيئًا عاجلًا، تحويلًا ماليًا أو رمزًا أو عنوانًا، لا تحاول الحكم على الصوت: فهذه الصفحة أظهرت للتوّ كم أن ذلك قليل الموثوقية. أغلِق الخطّ، واتّصل أنت على الرقم الذي لديك سلفًا، لا على الذي اتّصل للتوّ. وإن كان لا بدّ أن تستمرّ المكالمة في الحال، اطرح سؤالًا لا يكون جوابه مكتوبًا في أي مكان عامّ. ويمكن لعائلة أو لفريق أن يتّفقوا سلفًا على كلمة لا يعرفها إلا الشخص الحقيقي، للأوضاع التي تجعل فيها العجالة كل شيء آخر صعب التحقّق. والخطوة لا تكلّف شيئًا: أما الاحتيال الموثَّق أعلاه فقد كلّف كثيرًا من ائتمن أذنه.

للمضيّ أبعد

العمل نفسه على صورة في فصل صورة مصنوعة. والطريقتان لوسم محتوى عند المصدر في فصل العلامات المائية. والأوضاع التي تُغلَق فيها الأداة مجتمعة في متى لا تستخدمه. وكل عروض الموقع التفاعلية مجتمعة في صفحة العروض التفاعلية، وفهرس الدورة في صفحة الفهم.

المصادر