النقاط الرئيسية
| النقطة | التفاصيل |
|---|---|
| اختبار روبوتات الدردشة | تم اختبار 6 روبوتات دردشة في 40 سؤالاً. |
| أداء الروبوتات | تفاوت جيد، لكن لا يمكن الوثوق بها تمامًا. |
| النتائج الأفضل | Perplexity، AI Mode، Google Gemini. |
| المشكلات في الإجابات | عدم مراعاة الفروق الإقليمية ووجود مصادر مشكوك فيها. |
مقدمة
تُعتبر **روبوتات الدردشة** المدعومة بالذكاء الاصطناعي من الأدوات المفيدة، حيث توفر **إجابات سريعة** على الاستفسارات المختلفة. ومع ذلك، تظهر نتائج اختبار من منظمة “ويتش؟” البريطانية أن **المعلومات ليست دائمًا دقيقة**.
تفاصيل الاختبار
أجريت منظمة “ويتش؟” اختبارًا على **ستة روبوتات دردشة**، حيث شمل 40 سؤالًا في مجالات متنوعة مثل:
- المال
- القانون
- الصحة
- التغذية
- حقوق المستهلك
- السفر
تقييم الجودة
قيم خبراء المنظمة جودة الإجابات، وأظهرت النتائج أن معظم الروبوتات تقدم مستوى جيد ولكن لا يمكن الوثوق بها بشكل كامل.
أداء الروبوتات
جاءت نتائج الأداء كما يلي:
| الروبوت | نسبة الإجابات الصحيحة |
|---|---|
| Perplexity | 72% |
| AI Mode (جوجل) | 70% |
| Google Gemini | 68% |
| Copilot (مايكروسوفت) | 67% |
| ChatGPT | 65% |
| Meta AI | 54% |
التحديات والمشكلات
أظهرت النتائج أن الذكاء الاصطناعي أحيانًا:
- يتجاهل الفروق الإقليمية.
- يوصي بسلوكيات غير قانونية.
- يعتمد على مصادر غير موثوقة.
- يغفل خيارات مجانية للخدمات المدفوعة.
الأسئلة الشائعة
ما هو الهدف من الاختبار؟
تقييم دقة روبوتات الدردشة المدعومة بالذكاء الاصطناعي.
أي روبوت حقق أفضل أداء؟
حقق روبوت **Perplexity** أفضل أداء بنسبة 72% من الإجابات الصحيحة.
هل يمكن الثقة في الإجابات دائمًا؟
لا، يجب عدم الاعتماد على الإجابات بشكل كامل.
ما هي المجالات التي تم اختبارها؟
شملت الاختبارات مجالات المال، القانون، الصحة، وغيرها.