الذكاء الاصطناعي المحلي: التعريف وطريقة العمل وأمثلة عملية
الذكاء الاصطناعي المحلي هو نموذج لغوي يحسب إجاباته على جهاز تتحكمون فيه، دون إرسال نصوصكم إلى مزود. يشرح هذا الدليل ما يحتويه هذا النموذج، وماذا يعني تشغيله لديكم، وما الذي يمكن توقعه منه بشكل معقول.
أمر واحد، وتنزيل واحد، ثم لا يخرج شيء
تختصر وثائق Ollama، وهو برنامج حر متاح لأنظمة macOS وWindows وLinux، نقطة الانطلاق في سطر واحد: أمر يكتب في الطرفية، ينزل نموذجا ويفتح محادثة. وبالنسبة إلى النموذج المأخوذ مثالا، Gemma 4 E2B، يزن الملف نحو 7.2 جيجابايت وتوصي الوثائق بذاكرة رسومية سعتها 8 جيجابايت، أو بذاكرة موحدة على جهاز Mac. وما إن يصبح هذا الملف على القرص حتى تحسب معالجات الجهاز كل إجابة. يمكنك فصل كابل الشبكة، وتستمر المحادثة.
هذا هو أبسط تعريف للذكاء الاصطناعي المحلي: نموذج ذكاء اصطناعي ينفذ على عتاد تملكه أو تتحكم فيه، سواء كان حاسوبا محمولا أو خادما موضوعا في خزانة تقنية أو صندوقا مخصصا. ونقيضه الخدمة البعيدة. فـ ChatGPT وGemini وLe Chat تتلقى نصك على خوادمها وتعالجه هناك وتعيد إليك النتيجة.
لفهم ما يحدث في الحالتين، يجب فتح الصندوق: ما هو النموذج اللغوي، وما الذي يحتويه الملف المنزل، وماذا يفعل الجهاز تحديدا حين ينتج إجابة.
النموذج اللغوي يتنبأ بتتمة النص
النموذج اللغوي الكبير، ويختصر غالبا LLM أي large language model، برنامج دُرِّب على مهمة تبدو متواضعة: تخمين قطعة النص التي تأتي بعد ذلك. ولوحة مفاتيح هاتفك، التي تقترح الكلمة التالية فوق الأزرار، تفعل الشيء نفسه بمقياس ضئيل. أما النموذج اللغوي فيفعله بدقة تجعله، بتسلسل التنبؤات، ينتج فقرات وملخصات وشيفرة وترجمات.
لا يتعامل النموذج مع كلمات بل مع رموز (tokens)، وهي أجزاء من النص قد تقابل كلمة كاملة أو مقطعا أو علامة ترقيم. تعطي وثائق OpenAI رتبة قدر للإنجليزية: الرمز يمثل نحو أربعة أحرف، أي ثلاثة أرباع الكلمة. وتستخدم هذه الوحدة لقياس كل شيء، من الطول الأقصى للتبادل، ويسمى نافذة السياق، إلى سرعة التوليد.
تسمى البنية التي جعلت هذه النماذج ممكنة Transformer. وصفت عام 2017 في ورقة بحثية بعنوان «Attention Is All You Need». فكرتها المركزية، آلية الانتباه، تتيح للنموذج أن يوزن، لكل رمز، أهمية جميع الرموز الأخرى في النص. وفي الجملة «العقد الذي وقعه العميل أمس ينتهي في مارس»، هذه الآلية هي التي تربط «ينتهي» بـ «العقد» رغم الكلمات المتخللة.
يجب أن نتذكر ما تعنيه هذه الآلية. ينتج النموذج التتمة الأكثر احتمالا بالنظر إلى ما رآه أثناء تدريبه. والمحتمل لا يعني الصحيح، وهذا الفارق يفسر معظم حدوده.
الأوزان: ما يحتويه الملف
ما ننزله عندما نثبت نموذجا هو أوزانه، وتسمى أيضا المعاملات. إنها أعداد، مليارات من الأعداد، تضبط واحدا واحدا أثناء التدريب كي تصبح التنبؤات جيدة. يمكن تشبيهها بمنزلقات طاولة مزج هائلة: لا يعني أي منزلق منفردا الكثير، لكن وضعها الإجمالي يحدد الصوت.
يقاس حجم النموذج بالمعاملات. نموذج Mistral 7B، الذي نشرته الشركة الفرنسية Mistral AI في 27 سبتمبر 2023، يضم 7.3 مليار معامل. وقد وزع برخصة Apache 2.0، التي تسمح بتنزيله واستخدامه وتثبيته أينما شئنا، بما في ذلك للاستخدام التجاري. نتحدث عن نموذج مفتوح الأوزان: تنشر الشركة الملف نفسه، لا مجرد وصول عن بعد.
تتعاقب مرحلتان في حياة النموذج. التدريب يصنع الأوزان من أحجام ضخمة من النصوص؛ وهو يستنفر موارد حوسبة هائلة ويبقى شأن بضعة مختبرات. ثم يستخدم الاستدلال هذه الأوزان الثابتة للإجابة عن سؤال؛ وهو، وحده، ما نشغله محليا. والفرق يشبه الفرق بين تأليف قاموس والرجوع إليه: الأول يستغرق سنوات، والثاني ثواني، ولا يحتاج أحد إلى إعادة تأليف القاموس ليبحث فيه عن كلمة.
تشغيل نموذج: المحرك والصيغة والتكميم
لتنفيذ هذه الأوزان نحتاج إلى محرك استدلال، وهو البرنامج الذي يحمل الملف في الذاكرة ويسلسل الحسابات. الأكثر انتشارا في عالم المحلي اسمه llama.cpp. كتب بلغتي C وC++ دون أي اعتماد خارجي، ويهدف إلى تشغيل النماذج بتثبيت أدنى على مجموعة واسعة من العتاد: شرائح Apple، ومعالجات x86 التقليدية، وبطاقات NVIDIA الرسومية عبر CUDA، أو بطاقات مصنعين آخرين عبر Vulkan. وتستطيع تطبيقات أسهل منالا، مثل Ollama أو LM Studio، قراءة صيغة الملف نفسها.
تسمى هذه الصيغة GGUF. بحسب وثائق Hugging Face، المنصة الرئيسية لمشاركة النماذج، يجمع ملف GGUF في ملف ثنائي واحد الأوزان ومجموعة موحدة من البيانات الوصفية: البنية، ومفردات الرموز، والإعدادات اللازمة للتحميل. ننسخه ونحمله فيعمل، كما يحمل ملف PDF خطوطه معه.
العامل الذي يحسم تقريبا كل شيء هو الذاكرة. في شكله الأصلي، يخزن كل معامل على 16 بتا، أي بايتين. فيشغل نموذج من 7.3 مليار معامل قرابة 15 جيجابايت، أكثر من ذاكرة معظم الحواسيب المكتبية. ويحل التكميم هذه المشكلة بتقريب الأوزان إلى عدد أقل من البتات، كما نقلل عدد ألوان صورة دون أن تلحظ العين الفرق للوهلة الأولى. يدعم llama.cpp تكميمات من 1.5 إلى 8 بتات. ونوع Q4_K، الشائع الاستخدام، يعادل 4.5 بت لكل وزن بحسب وثائق Hugging Face: فينزل النموذج نفسه إلى نحو 4 جيجابايت.
لهذا الضغط ثمن، هو فقدان طفيف في الدقة يزداد كلما نزلنا في عدد البتات. والذاكرة لا تخدم تخزين الأوزان وحده. تذكر وثائق Ollama أن نافذة السياق الأطول تتطلب ذاكرة أكبر، لأن الجهاز يحتفظ بأثر النص كله قيد المعالجة. وإذا نقصت الذاكرة الرسومية، يمكن للبرنامج أن يلجأ إلى الذاكرة العشوائية العادية، بإجابات أبطأ. يتحدد اختيار العتاد بثلاثة معاملات: حجم النموذج، ومستوى تكميمه، وطول النصوص المراد معالجتها.
لماذا صار الأمر واقعيا في بضع سنوات
حتى وقت قريب، كان تشغيل نموذج كفء على جهاز واحد أقرب إلى عرض مخبري. وتبين ثلاثة قياسات نشرت في AI Index 2025 من جامعة ستانفورد ما الذي تغير.
الأول يخص الحجم. في عام 2022، كان أصغر نموذج يتجاوز 60% من الإجابات الصحيحة في MMLU، وهو اختبار متعدد الخيارات يغطي تخصصات كثيرة، هو PaLM من Google بـ 540 مليار معامل. وفي عام 2024، تجاوز Phi-3-mini من Microsoft العتبة نفسها بـ 3.8 مليار معامل، أي نموذج أصغر 142 مرة. وبعد تكميمه، يتسع نموذج بهذا الحجم في ذاكرة حاسوب محمول.
الثاني يخص الفجوة بين النماذج المغلقة والنماذج مفتوحة الأوزان. في بداية يناير 2024، على تصنيف Chatbot Arena، الذي يقارن فيه مستخدمو الإنترنت إجابات نموذجين دون معرفة هويتهما، كان أفضل نموذج مغلق يتقدم على أفضل نموذج مفتوح بنسبة 8.04%. وفي فبراير 2025، لم يعد الفارق إلا 1.70%.
الثالث يخص التكلفة. وفقا لستانفورد أيضا، قسمت تكلفة الاستدلال لنظام بمستوى GPT-3.5 على أكثر من 280 بين نوفمبر 2022 وأكتوبر 2024. وفي الفترة نفسها، انخفضت تكلفة العتاد بنحو 30% سنويا وتحسنت كفاءته في استهلاك الطاقة بنسبة 40% سنويا.
تصف هذه الأرقام اتجاها لا تساويا. تحتفظ أكبر النماذج المغلقة بالأفضلية في أصعب المهام، وتصنيف مبني على تفضيلات مستخدمي الإنترنت لا يقيس كل شيء. ومع ذلك فقد تحركت حدود ما يمكن فعله دون مركز بيانات تحركا واضحا.
المحلي أم ChatGPT: السؤال هو أين يسافر النص
من وجهة نظر المستخدم، تتشابه التجربتان: خانة إدخال، وإجابة تظهر كلمة بعد كلمة. يكمن الفرق في المسار. مع خدمة عبر الإنترنت، يمر السؤال والمستندات المرفقة والإجابة عبر خوادم المزود. ومع ذكاء اصطناعي محلي، لا تغادر الجهاز.
لهذا المسار عواقب ملموسة. تشير OpenAI إلى أن محادثات حسابات ChatGPT المجانية وPlus يمكن أن تستخدم لتحسين نماذجها ما لم يعطل المستخدم الخيار، بينما لا تستخدم بيانات عروضها المهنية وAPI افتراضيا. وتلاحظ CNIL، في أسئلتها وأجوبتها حول الذكاء الاصطناعي التوليدي الصادرة في يوليو 2024، أنه مع الاستخدام عبر API يكون التحكم في النظام «بشكل شبه حصري» بيد المزود. وتوصي بالنشر في الموقع عند معالجة بيانات شخصية أو حساسة، للحد من مخاطر الاستخراج من طرف ثالث.
وتسير ANSSI، الوكالة الوطنية لأمن نظم المعلومات، في الاتجاه نفسه في توصياتها الأمنية لنظم الذكاء الاصطناعي التوليدي الصادرة في 29 أبريل 2024. فتوصيتها R34 تنصح بعدم استخدام أدوات الذكاء الاصطناعي التوليدي المتاحة على الإنترنت في الاستخدام المهني الذي يتضمن بيانات حساسة: فالمؤسسة لا تتحكم في الخدمة ولا تستطيع بالتالي ضمان سرية ما ترسله إليها.
وللمحلي خصائص أخرى. فهو يعمل دون اتصال. ولا تتوقف تكلفته على عدد الأسئلة المطروحة، لأنه عتاد مشترى لا عداد. ولا يتغير بين ليلة وضحاها لأن مزودا استبدل نموذجا أو سحبه. وفي المقابل، تدير المؤسسة بنفسها الجهاز والتحديثات والنسخ الاحتياطية، ولا تصل إلى أكبر النماذج المغلقة التي تعرض عبر الإنترنت فقط. وتجمع مؤسسات كثيرة بين الاثنين: المحلي لما هو سري أو متكرر، وخدمة بعيدة للاحتياجات العرضية الخالية من البيانات الحساسة.
ما يمكن فعله عمليا بذكاء اصطناعي محلي
الاستخدامات الأفضل أداء هي التي يعمل فيها النموذج على نص نقدمه له، بدل الاستقاء من ذاكرته. تلخيص محضر اجتماع من ثلاثين صفحة. إعادة صياغة رسالة بأسلوب أكثر حيادا. استخراج المورد والتاريخ والمبلغ من فاتورة لوضعها في جدول. ترجمة نشرة تقنية. تصنيف رسائل البريد الواردة بحسب موضوعها قبل توجيهها إلى الإدارة المناسبة.
الحالة الأكثر طلبا في الشركات هي استجواب مستنداتها الخاصة: الإجراءات الداخلية، والعقود، والاتفاقيات، وقاعدة معارف الدعم. والتقنية المستخدمة، وتسمى RAG أي التوليد المعزز بالاسترجاع، تسترجع أولا المقاطع المناسبة، ثم تطلب من النموذج أن يجيب انطلاقا منها مستشهدا بمصادره. وقد خصصنا لها مقالا مفصلا.
ثم تأتي استخدامات أكثر تقنية: المساعدة في كتابة الشيفرة، ونسخ الاجتماعات بنموذج تعرف على الكلام ينفذ هو أيضا في الموقع، وتحليل سجلات الأخطاء. وتنتشر هذه الاستخدامات بسرعة. بحسب Eurostat، استخدمت 20% من الشركات الأوروبية التي توظف عشرة أشخاص فأكثر تقنية ذكاء اصطناعي عام 2025، مقابل 13.5% قبل سنة.
في جميع هذه الحالات، ينتج الجهاز مسودة أولى أو فرزا، ويصادق شخص عليهما. وفي هذا التكوين تكون النسبة بين الوقت الموفر والمخاطرة المتحملة هي الأفضل.
الحدود، دون تجميل
قد يؤكد النموذج اللغوي بثقة أمرا خاطئا. وهذه الظاهرة، وتسمى الهلوسة، تنتج مباشرة من طريقة عمله: فهو ينتج نصا محتملا، والنص المحتمل قد يتضمن تاريخا مختلقا أو مرجعا قانونيا غير موجود أو رقما منسوخا خطأ. والتشغيل المحلي لا يغير شيئا في هذه النقطة. الحل أن نزوده بالمصادر بدل الاعتماد على ذاكرته، وأن نراجع كل ما يلزم المؤسسة.
تتوقف معارفه عند نهاية تدريبه. فنموذج نشر قبل سنة يجهل آخر إصلاح وآخر جدول وآخر نسخة من برنامج. وهو لا يتصفح الإنترنت من تلقاء نفسه: فالذكاء الاصطناعي المحلي المعزول عن الشبكة لا يعرف إلا ما تعلمه وما نعطيه ليقرأه.
النموذج الصغير يبقى نموذجا صغيرا. التقدم الذي قاسته ستانفورد حقيقي، لكن نموذجا من بضعة مليارات من المعاملات يخطئ أكثر من نموذج عملاق في استدلال متعدد الخطوات أو في حساب أو في سؤال شديد التخصص. وتتوقف السرعة على العتاد: ففي حاسوب بلا معالج رسومي مناسب قد تتأخر إجابة طويلة.
أخيرا، التثبيت المحلي نظام معلوماتي كغيره. يجب إدارته وتطبيق التصحيحات ومراقبة من يصل إليه. وتخصص ANSSI جزءا من توصياتها لعزل أنظمة الذكاء الاصطناعي وتسجيل المعالجات وإدارة الحقوق. المحلي لا يعني آمنا افتراضيا؛ بل يعني أن الأمن يتوقف على المؤسسة التي تشغله.
كيف نبدأ
الأبسط هو التجربة على حاسوب حديث بتطبيق مثل Ollama أو LM Studio. اختر نموذجا صغيرا مفتوح الأوزان، من بضعة مليارات من المعاملات، مكمما على 4 بتات. جربه على مهام حقيقية لكن دون بيانات سرية: تلخيص مستند عام، وإعادة صياغة نص، واستخراج معلومات من استمارة فارغة. دون الجودة والسرعة والأخطاء.
تفيد هذه الخطوة الأولى في تحديد الاحتياجات قبل أي إنفاق: الاستخدامات التي تتكرر كل أسبوع، وحجم المستندات المراد معالجتها، وعدد الأشخاص الذين سيستخدمون النظام في الوقت نفسه. وهذه العناصر تحدد حجم النموذج، ومن ثم الذاكرة اللازمة، ومن ثم العتاد.
للاستخدام الجماعي، لا يكفي الحاسوب المحمول التجريبي. يلزم جهاز يبقى مشغلا، ومتاحا على الشبكة الداخلية، مع إدارة للحسابات والحقوق والسجلات. وهذا دور الخادم أو الصندوق المخصص.
في HOMN، هذا التكوين الأخير هو ما نبنيه: النموذج والمستندات والسجلات تبقى على جهاز مثبت لدى المستخدم، ويظل اللجوء إلى خدمة خارجية خيارا صريحا. والنهج صالح أيا كانت الأداة المختارة: أن تعرف أين يعمل النموذج، وما الذي يحتويه، وإلى أين تذهب البيانات.
ما هو الذكاء الاصطناعي المحلي؟
الذكاء الاصطناعي المحلي نموذج ذكاء اصطناعي، وهو في الغالب نموذج لغوي، ينفذ على عتاد يتحكم فيه المستخدم: حاسوب أو خادم أو صندوق مثبت في مقره. لا ترسل الأسئلة والمستندات المعالجة إلى خوادم مزود. والنموذج ملف ينزل مرة واحدة ثم يستخدم دون اتصال.
هل يلزم اتصال بالإنترنت لاستخدام ذكاء اصطناعي محلي؟
لا، ليس للتشغيل. يفيد الإنترنت في تنزيل النموذج وتحديثات البرنامج، لكن حساب الإجابات يتم بالكامل على الجهاز. لذلك يمكن لذكاء اصطناعي محلي أن يعمل على شبكة معزولة.
هل الذكاء الاصطناعي المحلي بكفاءة ChatGPT نفسها؟
ليس في كل شيء: فأكبر النماذج المغلقة تظل متقدمة في مهام الاستدلال الأصعب. لكن الفجوة تقلصت كثيرا، إذ انتقلت بحسب AI Index 2025 من ستانفورد من 8.04% إلى 1.70% على تصنيف Chatbot Arena بين يناير 2024 وفبراير 2025. وللتلخيص وإعادة الصياغة والاستخراج واستجواب المستندات، يكفي نموذج جيد مفتوح الأوزان في معظم الحالات.
ما العتاد اللازم لتشغيل LLM محليا؟
يتوقف كل شيء على حجم النموذج وتكميمه. نموذج من 7 مليارات معامل مكمم على 4 بتات يشغل نحو 4 جيجابايت، وتوصي وثائق Ollama بذاكرة رسومية أو موحدة سعتها 8 جيجابايت لنموذج المثال فيها. وللاستخدام المشترك من فريق، يلزم جهاز مخصص بذاكرة أكبر.