كيفية كتابة أوامر ChatGPT Images 2.0
طريقة كتابتك لأمرك تشكّل المخرجات مباشرةً. يعالج GPT Image 2 اللغة تسلسليًا، لذا تحمل الكلمات في بداية أمرك أكبر وزن بصري. إليك إطار عمل لكتابة الأوامر يحقّق أفضل النتائج.
1. ابدأ بالنمط البصري
الكلمات الأولى تحدّد الاتجاه الجمالي للصورة كلها. سمِّ نمطًا محددًا قبل وصف أي شيء آخر. دفن النمط في النهاية يقلّل تأثيره على المخرجات.
| بدون التوجيه | مع التوجيه |
|---|---|
| رجل مسنّ يبيع الفاكهة في سوق، اجعلها تبدو سينمائية وكئيبة | لقطة واسعة بنمط الرسم غير اللامع لبائع مسنّ يرتّب الرمان في كشك سوق مفتوح، سماء غائمة، ضوء رمادي منتشر، برك تعكس المظلة أعلاه، ألوان ترابية باهتة مع لمسات من الأحمر العميق |
الأمر الأول يدفن النمط في فكرة عابرة غامضة («اجعلها تبدو سينمائية وكئيبة»). أما الثاني فيفتتح بـ «لقطة واسعة بنمط الرسم غير اللامع»، ما يثبّت الجماليات كلها قبل وصف أي شيء آخر.
جرّب النسخة المحسّنة:

لقطة واسعة بنمط الرسم غير اللامع لبائع مسنّ يرتّب الرمان في كشك سوق مفتوح، سماء غائمة، ضوء رمادي منتشر، برك تعكس المظلة أعلاه، ألوان ترابية باهتة مع لمسات من الأحمر العميق
2. اتّبع ترتيب أوامر متسقًا
اكتب الأوامر ببنية متسقة: الخلفية أو المشهد أولًا، ثم الموضوع، ثم التفاصيل الرئيسية، ثم القيود. للطلبات المعقّدة، استخدم مقاطع قصيرة معلّمة بدلًا من فقرة واحدة طويلة.
| عنصر الأمر | ما تُدرجه | مثال |
|---|---|---|
| المشهد / الخلفية | المكان، البيئة، الأسطح | سطح رخامي في حمّام بجوار نافذة بزجاج مصنفر |
| الموضوع | الجسم أو الشخص الرئيسي | زجاجة عناية بالبشرة عليها ملصق 'Dew Drop Serum' وشعار ورقة بسيط |
| التفاصيل | الموضع، الألوان، الخامات، النص | موضوعة قليلًا خارج المركز، زجاجة زجاج مصنفر، سائل أخضر شاحب مرئي بالداخل |
| القيود | الإضاءة، عمق الميدان، ما يُتجنّب | ضوء صباح ناعم منتشر عبر النافذة المصنفرة، عمق ميدان ضحل، لا منتجات أخرى على السطح |
| بدون التوجيه | مع التوجيه |
|---|---|
| زجاجة عناية بالبشرة على سطح حمّام، الملصق يقول Dew Drop Serum وعليه ورقة، إضاءة جميلة، مظهر نظيف | المشهد: سطح رخامي في حمّام بجوار نافذة بزجاج مصنفر. الموضوع: زجاجة عناية بالبشرة عليها ملصق 'Dew Drop Serum' وشعار ورقة بسيط، موضوعة قليلًا خارج المركز. التفاصيل: زجاجة زجاج مصنفر، سائل أخضر شاحب مرئي بالداخل، قطرات ماء على السطح الرخامي. القيود: ضوء صباح ناعم منتشر عبر النافذة المصنفرة، عمق ميدان ضحل، لا منتجات أخرى على السطح. |
الأمر الأول يقفز بين التفاصيل عشوائيًا. أما الثاني فيستخدم مقاطع معلّمة ليعالج النموذج كل عنصر بالترتيب.
جرّب النسخة المحسّنة:

المشهد: سطح رخامي في حمّام بجوار نافذة بزجاج مصنفر. الموضوع: زجاجة عناية بالبشرة عليها ملصق 'Dew Drop Serum' وشعار ورقة بسيط، موضوعة قليلًا خارج المركز. التفاصيل: زجاجة زجاج مصنفر، سائل أخضر شاحب مرئي بالداخل، قطرات ماء على السطح الرخامي. القيود: ضوء صباح ناعم منتشر عبر النافذة المصنفرة، عمق ميدان ضحل، لا منتجات أخرى على السطح.
3. ضع النص الدقيق بين علامات اقتباس
حين تريد نصًا مُصيَّرًا داخل الصورة، ضعه بين علامتَي اقتباس مزدوجتين في الأمر. هذا يشير للنموذج ليصيّر الحروف الدقيقة التي حدّدتها. اقرن النص المقتبس دائمًا بتوجيه مكاني صارم لتحسين دقة التموضع.
| بدون التوجيه | مع التوجيه |
|---|---|
| لافتة نيون تقول open late فوق نافذة، متوهجة بالأحمر | لافتة نيون حمراء متوهجة تقرأ "OPEN LATE" في وسط أعلى النافذة، خط متصل، وهج أحمر دافئ ينعكس على الزجاج أسفلها |
الأمر الأول يترك النص دون اقتباس، ما يعني أن النموذج قد يصيّر «Open Late» أو «OPEN late» أو شيئًا آخر تمامًا. أما الثاني فيقتبس النص الدقيق ويحدّد أين ينبغي أن يظهر.
جرّب النسخة المحسّنة:

لافتة نيون حمراء متوهجة تقرأ "OPEN LATE" في وسط أعلى النافذة، خط متصل، وهج أحمر دافئ ينعكس على الزجاج أسفلها
4. حدّد الإضاءة صراحةً
سمِّ نوع الضوء واتجاهه معًا بدلًا من استخدام مصطلحات غامضة مثل «إضاءة جيدة». إعدادات الإضاءة المحددة تمنح GPT Image 2 مرجعًا فيزيائيًا يتبعه.
| بدون التوجيه | مع التوجيه |
|---|---|
| صورة شخصية لامرأة في مقهى، إضاءة جيدة، مزاج دافئ | صورة شخصية لامرأة جالسة بجوار نافذة مقهى، ضوء نهار طبيعي ناعم من اليسار، ملء تنغستن دافئ من مصابيح معلّقة علوية، ظلال لطيفة على الجانب الأيمن من وجهها |
الأمر الأول لا يمنح النموذج أي معلومة إضاءة يعمل بها. أما الثاني فيسمّي مصدرَي ضوء واتجاهيهما وسلوك الظل الناتج.
جرّب النسخة المحسّنة:

صورة شخصية لامرأة جالسة بجوار نافذة مقهى، ضوء نهار طبيعي ناعم من اليسار، ملء تنغستن دافئ من مصابيح معلّقة علوية، ظلال لطيفة على الجانب الأيمن من وجهها
5. صِف الصورة الفوتوغرافية، لا الخيال
للمخرجات فائقة الواقعية، صِف العدسة والتأطير ووقت اليوم ومصدر الضوء والقوام وبلى السطح وتفاصيل الخلفية العادية. يمكن لتمريرة توليد نظيفة واحدة أن تنتج واقعية مقنعة حين يثبّت الأمر سلوك الكاميرا والبيئة.
| بدون التوجيه | مع التوجيه |
|---|---|
| طاهٍ يطبخ في مطبخ مطعم، واقعي، أجواء احترافية | لقطة عفوية فائقة الواقعية لطاهية بمعطف أبيض ملطّخ ترتّب طبقًا عند ممر فولاذي، بخار يتصاعد من قدر خلفها، فلورسنت علوي حاد ممزوج بوهج مصباح حراري دافئ من الممر، عمق ميدان ضحل، بلاط أرضية مخدوش وشريط طلبات مجعّد مثبّت على القضيب في الخلفية |
الأمر الأول يصف مزاجًا («أجواء احترافية»). أما الثاني فيصف ما ستراه الكاميرا فعلًا: بلى ملابس محدد، عيوب سطح، مصادر ضوء متعددة، وفوضى خلفية تجعل الصورة تبدو حقيقية.
جرّب النسخة المحسّنة:

لقطة عفوية فائقة الواقعية لطاهية بمعطف أبيض ملطّخ ترتّب طبقًا عند ممر فولاذي، بخار يتصاعد من قدر خلفها، فلورسنت علوي حاد ممزوج بوهج مصباح حراري دافئ من الممر، عمق ميدان ضحل، بلاط أرضية مخدوش وشريط طلبات مجعّد مثبّت على القضيب في الخلفية
6. استخدم منطق العمودين للتعديلات
عند تحرير صورة موجودة، هيكِل أمرك بفصل واضح بين ما ينبغي أن يتغيّر وما ينبغي أن يبقى مثبّتًا. استخدم هذا الجدول إطار عمل:
| العنصر | التعليمات | مثال |
|---|---|---|
| التغيير | صِف بالضبط ما ينبغي أن يختلف | بدّل الخلفية إلى شاطئ استوائي عند الغروب |
| الحفظ | اذكر ما يجب أن يبقى دون مساس | أبقِ وجه الشخص وهويته ووضعيته وزيّه والإضاءة عليه متطابقة |
| القيود | حدّد ما يُتجنّب | لا عناصر إضافية، لا تغييرات على ملصق المنتج، لا انحراف في الشعار |
| بدون التوجيه | مع التوجيه |
|---|---|
| غيّر الخلفية إلى شاطئ | التغيير: استبدل خلفية الاستوديو بشاطئ استوائي عند الغروب، ضوء ساعة ذهبية على الأفق. الحفظ: أبقِ وجه الشخص وتعبيره ووضعيته وزيّه ونسب جسمه كما هي تمامًا. أبقِ الإضاءة على الموضوع ثابتة. القيود: لا أشخاص أو عناصر إضافية في المشهد، لا تغييرات على لون البشرة أو الشعر. |
الأمر الأول يمنح النموذج حرية إعادة تفسير كل شيء. أما الثاني فيثبّت ما يبقى كما هو، فتتغيّر الخلفية فقط.
ما يُفعل وما لا يُفعل في ChatGPT Images 2.0
| افعل | لا تفعل |
|---|---|
| ضع النص الدقيق بين علامات اقتباس في أمرك | ترك النص دون اقتباس وتوقّع أن يخمّن النموذج الإملاء |
| سمِّ نوع إضاءة واتجاهًا محددين («إضاءة فلورسنت طبيعية»، «ضوء نافذة ناعم من اليسار») | استخدام «إضاءة جيدة» أو تخطّي الإضاءة كليًا |
| صِف العدسة والتأطير ووقت اليوم ومصدر الضوء للمخرجات فائقة الواقعية | الاعتماد على كلمات نمط غامضة («جميل»، «جودة عالية»، «احترافي») |
| اقرن النص المقتبس بتوجيهات مكانية صارمة («في وسط أعلى النافذة») | افتراض أن النموذج سيضع النص حيث تريد |
| ابدأ أمرك بالنمط البصري قبل الموضوع | دفن النمط في نهاية أمر طويل |
| ارفع صورًا مرجعية عند التحرير، وعلّم كل واحدة بدورها | وصف صورة موجودة من الذاكرة بدلًا من رفعها |
| استخدم منطق العمودين للتعديلات: حدّد ما يتغيّر وما يبقى مثبّتًا | إعطاء تعليمات تحرير مفتوحة دون قيود حفظ |
| اتّبع ترتيب أوامر متسقًا: المشهد، الموضوع، التفاصيل، القيود | كتابة فقرة واحدة طويلة غير مهيكلة للطلبات المعقّدة |
ما الجديد في ChatGPT Images 2.0
GPT Image 2 ليس مجرد تحديث تدريجي عن سابقه. أكبر تغيير في البنية هو دمج قدرات الاستدلال في عملية توليد الصور. عند استخدامه مع وضع التفكير أو الوضع الاحترافي، يستطيع النموذج تفكيك الطلبات البصرية المعقّدة، والنظر في العلاقات المكانية، وإنتاج تكوينات أدقّ من المحاولة الأولى.
كما يضمّ النموذج معرفة بالعالم حتى ديسمبر 2025، ما يعني أنه يستطيع الإشارة إلى العلامات والمنتجات واللحظات الثقافية واتجاهات التصميم الحديثة دون حاجة إلى وصفها من الصفر. لم تكن نماذج الصور السابقة على وعي بالعالم خارج بيانات تدريبها، ما جعلها غير موثوقة لأي شيء حسّاس للوقت.
بالمقارنة مع DALL-E 3، الذي رُبط بـ ChatGPT كأداة منفصلة، يندمج GPT Image 2 أصليًا في بنية GPT-4o. هذا يمنحه فهمًا أدقّ للأوامر، واتّباعًا أفضل للتعليمات، والقدرة على التعامل مع الأوامر متعددة الأجزاء التي كانت ستربك النماذج السابقة.
قدرات ChatGPT Images 2.0
تصيير نص دقيق عبر لغات متعددة
يصيّر GPT Image 2 النص بما تسمّيه OpenAI «دقة غير مسبوقة». يتعامل النموذج مع الحروف الصغيرة والفقرات الكثيفة والنص على الأسطح المنحنية والكتابات غير اللاتينية بما فيها الصينية واليابانية والكورية والهندية والبنغالية. تخرج ملصقات التعبئة ولافتات الشوارع وأزرار واجهة المستخدم وتعليقات الرسوم المعلوماتية والمواد التسويقية متعددة اللغات مقروءة من التوليد الأول. كانت النماذج السابقة كثيرًا ما تشوّه النص أو تخطئ إملاءه داخل الصور، ما يجعل التصحيح اليدوي جزءًا معتادًا من سير العمل. يزيل GPT Image 2 تلك الخطوة للغالبية العظمى من حالات الاستخدام.
تحرير الصور من رفع المراجع
ارفع صورة موجودة وصِف ما تريد تغييره. يستطيع النموذج تبديل خلفية، أو تحديث نص ملصق، أو ضبط ظروف الإضاءة، أو وضع منتج في بيئة مختلفة مع الحفاظ على التفاصيل التي لم تذكرها. يمكنك أيضًا رفع عدة صور مرجعية لتوجيه المخرجات نحو مظهر أو تكوين أو مظهر شخصية محدد. هذا يجعل GPT Image 2 مفيدًا ليس فقط للتوليد من الصفر بل للتكرار على الأصول الموجودة.
تصوير المنتجات بثبات العلامة التجارية
ولّد لقطات منتجات يكون فيها اسم العلامة على الملصق، وقائمة المكوّنات في الخلف، والشعار على الغطاء كلها مكتوبة بإملاء صحيح وثابتة بصريًا. شغّل الأمر نفسه بمشاهد أو زوايا مختلفة فيحافظ النموذج على لوحة ألوانك وطباعتك عبر كل تنويعة. لفرق التجارة الإلكترونية التي تحتاج إلى كتالوج كامل يبدو موحّدًا دون إعادة تصوير، يعني هذا توليد عدة صور منتجات من جلسة أمر واحدة.
توليد نماذج واجهة المستخدم والتطبيقات
يستطيع GPT Image 2 إنتاج صور تبدو كواجهات برامج حقيقية: نوافذ متصفح، وشاشات تطبيقات جوال، ولوحات معلومات، وقوائم تنقّل، وتصورات بيانات بتسميات صحيحة. تمتد دقة تصيير النص إلى عناصر واجهة المستخدم مثل الأزرار وتسميات علامات التبويب وحقول النماذج، ما يجعل المخرجات مفيدة لتخطيط الأفكار البصرية، أو إنشاء لقطات شاشة للوثائق، أو تصوّر أفكار التطبيقات قبل كتابة أي شفرة.
ثبات الشخصية عبر عدة لقطات
ثبّت شخصية أو منتجًا أو أصل علامة تجارية وأبقِه متطابقًا بصريًا عبر عدة عمليات توليد. تبقى الوجوه والأزياء والنسب والتفاصيل المميّزة ثابتة بينما تتغيّر الخلفيات والوضعيات والمشاهد. هذا مفيد للوحات القصصية، وتنويعات الحملات التي تحتاج إلى شخصية متكررة، ومحتوى وسائل التواصل متعدد اللقطات حيث تهمّ الاستمرارية البصرية.
صيغ مخرجات متعددة والتحكم في الضغط
المخرجات متاحة بصيغة PNG أو JPEG أو WebP مع ضغط قابل للتعديل من 0 إلى 100% لصيغتَي JPEG وWebP. هذا يعني أن الملفات تخرج بحجم وصيغة مناسبين لحالة استخدامك المحددة، سواء كانت PNG عالية الدقة للطباعة أو WebP مضغوطة لأداء الويب، دون تمريرها عبر أداة تحويل أخرى.
مخرجات فائقة الواقعية بدقة تصل إلى 2K
ينتج النموذج صورًا بإضاءة طبيعية وقوام خامات أصيل وألوان بشرة واقعية بدقة تصل إلى 2K (2560x1440). تُستبدل النبرة اللونية الدافئة والمظهر الأملس البلاستيكي الشائع في نماذج الصور بالذكاء الاصطناعي السابقة بمخرجات تُقرأ أقرب إلى تصوير الاستوديو. يمتد دعم نسب الأبعاد من 3:1 (عريضة جدًا) إلى 1:3 (طويلة جدًا)، مغطّيًا صيغًا من اللافتات وشرائح العروض إلى شاشات الجوال والمنشورات الاجتماعية العمودية. الدقات الأعلى ممكنة تقنيًا لكن OpenAI تعتبر النتائج فوق 2K تجريبية.
المواصفات التقنية لـ ChatGPT Images 2.0
| المواصفة | التفاصيل |
|---|---|
| تصيير النص | دقة عالية عبر الكتابات اللاتينية، وCJK (الصينية، اليابانية، الكورية)، والهندية، والبنغالية |
| أقصى دقة | 2K (2560x1440) موثوقة، الدقات الأعلى تجريبية |
| الأحجام المسبقة | 1024x1024، 1536x1024، 1024x1536، أو أبعاد مخصّصة (يجب أن يكون كلا الطرفين من مضاعفات 16) |
| نسب الأبعاد | 3:1 إلى 1:3 (عريضة جدًا إلى طويلة جدًا) |
| صيغ المخرجات | PNG (افتراضي)، JPEG، WebP |
| مستويات الجودة | منخفضة، متوسطة، عالية، تلقائية |
| الضغط | قابل للتعديل 0-100% (JPEG وWebP) |
| عدد الصور لكل طلب | حتى 10 |
| صور الإدخال | يدعم رفع المراجع للتحرير |
| بنية النموذج | مدمجة أصليًا في GPT-4o مع استدلال بصري |
حالات استخدام ChatGPT Images 2.0
-
المبدعون والمستقلون: ولّد نماذج منتجات جاهزة للعميل، ورسوميات وسائل تواصل، وصور مفاهيم في ثوانٍ. اصقل عبر أوامر متابعة أو تعديلات بصور مرجعية بدلًا من جولات مراجعة متعددة مع مصمّم.
-
فرق التجارة الإلكترونية والتسويق: أنشئ لقطات منتجات بملصقات دقيقة، ورسوميات وسائل تواصل بنص ترويجي مضمّن، ورسومًا معلوماتية بتعليقات بيانات. يقلّل تصيير النص وثبات العلامة عبر عدة لقطات التحرير اليدوي اللاحق الذي تطلّبته النماذج السابقة.
-
المصمّمون وفرق المنتج: أنتج نماذج واجهة مستخدم، ومفاهيم مخططات هيكلية، وتصورات شاشات تطبيقات بمحتوى واقعي وطباعة صحيحة. مفيد لعروض أصحاب المصلحة، ومراجعات التصميم، والتحقق من الأفكار قبل الالتزام بعمل الإنتاج.
-
فرق المحتوى: ولّد رسوم مدوّنات، ومرئيات نشرات إخبارية، ومواد تسويقية متعددة اللغات، ورسومًا معلوماتية تعليمية بنص وتسميات بيانات دقيقة مباشرةً، مقلّلًا التنقّل بين كتّاب المحتوى والمصمّمين.
الأسئلة الشائعة
ChatGPT Images 2.0، ويُشار إليه أيضًا بـ GPT Image 2، هو نموذج توليد وتحرير الصور من OpenAI الصادر في أبريل 2026. يخلف GPT Image 1.5 ومبنيّ أصليًا في بنية GPT-4o. يولّد النموذج صورًا من أوامر نصية، ويحرّر الصور الموجودة، ويصيّر النص داخل الصور بدقة عالية عبر الكتابات اللاتينية وCJK والهندية والبنغالية.
يُدخل GPT Image 2 قدرات الاستدلال في توليد الصور لأول مرة، ما يتيح له تحليل الأوامر المعقّدة بعمق أكبر. وهو مدمج أصليًا في GPT-4o بدلًا من كونه أداة منفصلة مثل DALL-E 3. تصيير النص محسّن بشكل كبير، وتحرير الصور من رفع المراجع أدقّ، ويضمّ النموذج معرفة بالعالم حتى ديسمبر 2025.
وازن GPT Image 1.5 بين السرعة والجودة، ما جعله مناسبًا للتكرار السريع. أما GPT Image 2 فيتّبع نهجًا يقدّم الجودة، مُعطيًا الأولوية للواقعية الفائقة ودقة النص وأمانة المخرجات. كما يضيف قدرات الاستدلال لأول مرة، ما يتيح له تفكيك الأوامر المعقّدة بفعالية أكبر، ويضمّ معرفة بالعالم حتى ديسمبر 2025.
نعم. ارفع صورة مرجعية واحدة أو أكثر وصِف التغييرات التي تريدها. يستطيع النموذج تعديل الخلفيات والنص والعناصر والإضاءة والتكوين مع الحفاظ على الأجزاء التي لم تشِر إليها في أمرك.
تبرز OpenAI تصييرًا قويًا للنص في الكتابات اللاتينية إضافةً إلى الصينية واليابانية والكورية والهندية والبنغالية. يُصيَّر النص بشكل صحيح على الأسطح المنحنية، وبأحجام صغيرة، وداخل التخطيطات الكثيفة مثل المواد التسويقية متعددة اللغات وتعبئة المنتجات.
يُخرج GPT Image 2 بصيغة PNG (افتراضي) أو JPEG أو WebP مع ضغط قابل للتعديل من 0 إلى 100% لصيغتَي JPEG وWebP. يدعم النموذج أحجام صور مرنة بخيارات مسبقة (1024x1024، 1536x1024، 1024x1536) وأبعاد مخصّصة حتى دقة 2K.
نعم. يستطيع النموذج تثبيت شخصية أو منتج أو أصل علامة تجارية وإبقاءه متطابقًا بصريًا عبر عدة عمليات توليد. تبقى الوجوه والأزياء والنسب والتفاصيل ثابتة بينما تتغيّر الخلفيات والمشاهد، وهو مفيد للوحات القصصية والحملات والمحتوى متعدد اللقطات.
