虎嗅

العنوان العربي: متدرب كيمي يؤسس شركة، وتقدر قيمتها بحوالي 20 مليارًا

原文:Kimi实习生开公司,估值快200亿了

“الكنز الجديد” للشباب: التحول الرائع لأعمال بيانات الذكاء الاصطناعي والاحتفال برأس المال

ملخص المحتوى الأساسي

تكشف هذه القصة عن تغيير هائل يحدث في الصناعة: أعمال تدريب بيانات الذكاء الاصطناعي، التي كانت تُعتبر في السابق “خدمات استعانة خارجية منخفضة الجودة”, تتم إعادة تعريفها الآن من قبل مجموعة من رواد الأعمال الشباب الذين يأتون من خلفيات شركات كبيرة (مواليد التسعينيات والألفية)، وأصبحت سريعًا محط اهتمام شركات رأس المال الاستثماري (VC).

في الماضي، كانت مهمة تصنيف البيانات تعني الاعتماد على عمالة رخيصة لوضع التسميات على الصور، وكانت العقبات منخفضة والأرباح ضئيلة، مما جعل المستثمرين لا يولونها اهتمامًا كبيرًا. لكن الآن، مع تطور النماذج الكبيرة وزيادة متطلباتها لجودة البيانات، بالإضافة إلى ظهور احتياجات جديدة مثل “بيئات التعلم المعزز”, لم تعد الشركات التي تعمل في مجال البيانات تبيع مجرد مجموعات البيانات، بل تبيع “البنية التحتية اللازمة للتدريب الذكي”.

تستخدم القصة مثالًا على شركة ناشئة تبلغ قيمتها 2.5 مليار دولار والتي ستحصل على استثمارات من شركات مثل سيريكس (Silicon Valley) وعلي بابا (Alibaba) وتينسنت (Tencent)، حيث تقوم هذه الشركات بتوفير بيانات متخصصة عالية الجودة وبناء بيئات تدريب قابلة للتحقق، وحتى دخولها في مجالات مثل التنبؤات المالية، مما ساعدها على الانتقال من “أعمال تدفق النقد” إلى “أسهم تكنولوجية ذات قيمة عالية”. وعلى الرغم من أن بيع البيانات بحد ذاته له حدوده، إلا أن هؤلاء الشباب يحاولون كسر هذه الحدود من خلال تقديم خدمات عبر الإنترنت (SaaS)، والتعمق في عمليات العملاء، وحتى استكشاف تقنيات مثل “التحسين الذاتي التكراري (RSI)”, لتحويل شركات البيانات إلى “مزودين للبيانات” في عصر الذكاء الاصطناعي، بل وحتى إلى “مصانع للنماذج الذكية”.

---

تحليل مفصل: فهم المنطق الجديد لأعمال بيانات الذكاء الاصطناعي من خمسة أبعاد

1. الانقلاب في الهوية: من “عمالة رخيصة” إلى “خريجي جامعات مرموقة”

التفسير البسيط:

في الماضي، كان تصنيف البيانات يعني مجموعة من الأشخاص في مدن من الدرجة الثالثة والرابعة يقومون بتحديد الصور مقابل أجور منخفضة. كانت هذه الوظيفة تعتمد على السعر، وكان من يقدم أقل سعرًا هو من يتم استخدامه.

لكن الآن، الوضع تغير؛ فالأشخاص الذين يقومون بتغذية الذكاء الاصطناعي بالبيانات هم في الغالب خريجو كليات اللغة الصينية في جامعات مرموقة، أو دكاترة من كليات الطب، أو حتى متدربون في شركات كبيرة مثل علي بابا ويوي زهي ميان (Alibaba and Yue Zhi Men). يسخرون من أنفسهم ويطلقون على أنفسهم “مقاولي البيانات”, لكن العمل الذي يقومون به مختلف تمامًا.

لماذا تغير الأمر؟

لأن الذكاء الاصطناعي أصبح أكثر ذكاءً، ولا يحتاج بعد الآن إلى كميات هائلة من البيانات ذات الجودة المنخفضة، بل يحتاج إلى بيانات عالية الجودة.

  • في الماضي: كان يكفي أن تخبر الذكاء الاصطناعي أن “هذا قطة” ليتعلم.
  • الآن: يحتاج الذكاء الاصطناعي إلى كتابة الكود، وأن يكون مثل الطبيب، وأن يكون مثل البرمجي… يجب أن يتم تقييم النصوص الطبية من قبل أشخاص حقيقيين، وأن يتم تصحيح الأكواد من قبل مبرمجين حقيقيين.

أجور هؤلاء الخبراء تصل إلى 500–1000 دولار في الساعة، وأكثر… انضمامهم لم يحسن فقط جودة البيانات، بل الأهم من ذلك أنهم يفهمون ما يحتاجه النموذج الذكي. يعرفون كيفية تصميم الأسئلة، وكيفية تنقية البيانات، وكيفية تحسين أداء الذكاء الاصطناعي من خلال التجارب المتكررة. هذا يحول عمل تصنيف البيانات الروتيني إلى عمل تقني يتطلب البحث والتطوير. رأس المال يقدر هذه المهارات التقنية العالية.

2. ترقية المتطلبات: من “تغذية الذكاء الاصطناعي” إلى “بناء بيئات تدريب متقدمة”

التفسير البسيط:

في الماضي، كان تدريب الذكاء الاصطناعي يشبه إطعام الأطفال؛ كنت تعطيه ألف صورة للقطة ليتعرف عليها. هذا ما يُعرف بـ “التعلم المشرف”، حيث تكون البيانات مجرد “أسئلة وإجابات”.

لكن الآن، يجب أن يصبح الذكاء الاصطناعي أكثر استقلالية، ولذلك تحتاج إلى بيئات تدريب تسمح له بالتعلم بشكل أفضل.

ما هي “بيئات التعلم المعزز”؟

تخيل أنك تريد تدريب الذكاء الاصطناعي على كتابة الكود…

  • في النموذج القديم: كنت تخبره إذا كان الكود جيدًا أم سيئًا.
  • في النموذج الجديد: تعطيه بيئة حقيقية حيث يمكنه كتابة الكود وتشغيله ورؤية شكل الصفحات… إذا فشلت الصفحة، تتلقى رسالة خطأ؛ وإذا كانت جميلة، تتلقى رسالة تفيد بأن الكود ناجح. يقوم الذكاء الاصطناعي بالتجارب المتكررة والتعديلات بنفسه، تمامًا مثل اللعب… من خلال مئات أو آلاف المحاولات، يتعلم كيفية كتابة الكود بشكل صحيح.

هذه هي البيئات التدريبية القابلة للتحقق والتغذية الراجعة… البيانات لم تعد مجرد ملفات ثابتة، بل عمليات ديناميكية.

الشركات التي توفر هذه البيئات باهظة الثمن ونادرة… شركات مثل أوبن أي (OpenAI) وأنثروبيك (Anthropic) تستثمر الكثير من المال في هذا المجال (تتوقع أوبن أي أن تصل تكاليف البيانات إلى 8 مليار دولار بحلول عام 2030). من يوفر هذه البيئات عالية الجودة يمتلك مفتاح تطور الذكاء الاصطناعي… ولهذا السبب، تحصل الفرق الصغيرة التي تعمل في هذا المجال (أقل من 20 شخصًا) على تقييمات عالية جدًا.

3. صورة رواد الأعمال: “الهاربون” من الشركات الكبيرة وأثرياء جدد

التفسير البسيط:

رواد الأعمال هؤلاء لهم خلفيات خاصة؛ ليسوا مبرمجين تقليديين ولا موظفي مبيعات تقليديين، بل هم “خبراء أعمال يفهمون التكنولوجيا”.

من أين يأتون؟

معظمهم من شركات تطوير النماذج الكبيرة مثل ديب سيك (DeepSeek) وكيمي (Kimi) وعلي بابا… شاركوا شخصيًا في تدريب النماذج، ويعرفون أين تكمن نقاط الضعف في فرق الخدمات الخارجية، وما يحتاجه الباحثون حقًا، وما هي المشاكل في عمليات إنتاج البيانات.

لماذا يحبهم رأس المال؟

1. انخفاض مخاطر الاستثمار: يفهمون المجال جيدًا، لذا لا حاجة لتعليمهم أساسيات التكنولوجيا.

2. كثافة الفريق العالية: قد يكون الفريق صغيرًا (أقل من 20 شخصًا)، لكن كل عضو فيه يمتلك مهارات بحثية (Researcher) وهندسية (Engineer) وإدارية (Business Sense).

3. إمكانات كبيرة للثراء: الشركات المماثلة في الخارج (مثل سكيل أيه آي، ميركور، أفتر كوييري، Scale AI، Mercor، AfterQuery) أسسها أشخاص في العشرينيات من عمرهم وأصبحوا مليارديرات… المستثمرون في الصين يرون نفس الفرصة ويستثمرون بكثافة.

4. التحديات التجارية: حدود أعمال بيانات الذكاء الاصطناعي وكيفية كسرها

التفسير البسيط:

على الرغم من أن القصة مثيرة، إلا أن المستثمرين يدركون أن بيع البيانات وحدها لا يكفي لتحقيق قيمة عالية (مثل 10 مليارات دولار).

المشاكل هي:

  • الهامش الربحي المنخفض: شركات مثل ميركور تدفع 60–70% من إيراداتها للمتخصصين (المقاولين). الأرباح قليلة، وكلما زاد حجم الشركة، زادت تكاليف الإدارة.
  • عدم استقرار الطلبات: تسليم البيانات يكون مرة واحدة… إذا كانت البيانات غير مطابقة للمواصفات، يمكن للعميل إلغاء الطلب في أي وقت… ليس مثل البرمجيات التي يمكن اشتراؤها بشكل دوري.
  • **صعوبات الخروج من ال