عندما نقرأ نحن جملة، نراها كلمات ومعاني.
لكن نموذج الذكاء الاصطناعي لا يقرأ النص بالطريقة نفسها تمامًا.
هو لا يرى الجملة كقطعة واحدة، ولا يتعامل دائمًا مع كل كلمة كوحدة كاملة. بدلًا من ذلك، يقسم النص إلى أجزاء صغيرة تسمى Tokens.
ما هو الـToken؟
الـToken هو وحدة صغيرة من النص يستخدمها نموذج الذكاء الاصطناعي لمعالجة اللغة.
قد يكون الـToken كلمة كاملة، مثل “كتاب”. وقد يكون جزءًا من كلمة، أو علامة ترقيم، أو حتى مسافة في بعض الحالات. الأمر يعتمد على طريقة تقسيم النص التي يستخدمها النموذج.
مثلًا، الجملة “أنا أحب الذكاء الاصطناعي” قد لا تُقسم دائمًا إلى أربع كلمات فقط. قد تتحول داخليًا إلى عدة Tokens، خاصة إذا كانت الكلمات طويلة أو مركبة.
لماذا لا يستخدم النموذج الكلمات فقط؟
لأن اللغات معقدة. بعض الكلمات طويلة، وبعضها نادر، وبعض اللغات تركب الكلمات بطريقة مختلفة. لذلك يكون من الأفضل للنموذج أن يتعامل مع أجزاء مرنة من النص بدل الاعتماد على قائمة ثابتة من الكلمات الكاملة.
هذه الطريقة تساعده على فهم كلمات جديدة أو نادرة عبر تقسيمها إلى أجزاء أصغر، بدل أن يعاملها كشيء مجهول تمامًا.
كيف يؤثر الـToken على استخدام الذكاء الاصطناعي؟
عندما تسمع أن نموذجًا يدعم نافذة سياق بحجم معين، فغالبًا هذا الحجم يُقاس بالـTokens، لا بالكلمات.
مثلًا، إذا قيل إن نموذجًا يستطيع التعامل مع 100 ألف Token، فهذا لا يعني بالضبط 100 ألف كلمة. قد يكون أقل أو أكثر حسب اللغة، طول الكلمات، علامات الترقيم، والمسافات.
لهذا السبب، قد تجد أن النص العربي أو النصوص المختلطة بين العربية والإنجليزية تُحسب بطريقة مختلفة عن النص الإنجليزي البسيط.
ما علاقة الـToken بالتكلفة؟
في كثير من خدمات الذكاء الاصطناعي، خصوصًا عبر API، يتم حساب الاستخدام بناءً على عدد الـTokens.
هناك Tokens تدخل إلى النموذج، مثل السؤال أو الملف أو المحادثة السابقة. وهناك Tokens يخرجها النموذج، مثل الإجابة التي يكتبها. وكلما زاد عددها، زاد الاستخدام وربما التكلفة.
لذلك، فهم الـToken يساعدك على فهم لماذا النصوص الطويلة أو الردود المفصلة قد تكون أكثر تكلفة أو أبطأ.
هل يحتاج المستخدم العادي إلى حساب الـTokens؟
ليس دائمًا.
إذا كنت تستخدم ChatGPT أو أداة مشابهة للمحادثة اليومية، فلن تحتاج غالبًا إلى عدّ الـTokens. لكن إذا كنت تعمل على ملفات طويلة، أو تبني تطبيقًا يعتمد على API، أو تريد فهم حدود النموذج، يصبح المفهوم مهمًا جدًا.
الخلاصة
الـToken هو الطريقة التي يجزّئ بها نموذج الذكاء الاصطناعي النص ليتمكن من معالجته.
نحن نرى كلمات وجملًا. أما النموذج فيراها كسلسلة من وحدات صغيرة، يبني منها الفهم والتوقع والإجابة.
قد يبدو المفهوم تقنيًا، لكنه يشرح أشياء كثيرة: لماذا توجد حدود للسياق، لماذا تختلف التكلفة، ولماذا يحتاج النص الطويل إلى مساحة أكبر داخل النموذج.