آموزش صفر تا صد ساخت کاراکتر با هوش مصنوعی و متحرکسازی اکشن اسپایدرمن
ساخت کاراکتر با هوش مصنوعی در سالهای اخیر به یکی از داغترین و هیجانانگیزترین ابزارهای خلق هنر دیجیتال برای نسل جوان تبدیل شده است، به طوری که امروز هر کسی میتواند ابرقهرمان رویاهای خود را بدون نیاز به دانش پیچیده گرافیکی خلق کند. ایده تولد یک اسپایدرمن ایرانی که به جای نیویورک، در میان برجها و خیابانهای شلوغ تهران پرواز کند، همیشه یک فانتزی جذاب برای گیکها و طرفداران کمیکبوک بوده است. به کمک مدلهای نوین پردازش تصویر و ویدیو، این رویای دور از دسترس به یک واقعیت دیجیتالی چنددقیقهای تبدیل شده است. در این مقاله تخصصی از رسانه باهوش، قصد داریم گام به گام فرآیند سینمایی ساخت یک اسپایدرمن بومی را بررسی کنیم. ما مسیر خود را از نقطه صفر یعنی پیریزی هویت فیزیکی و طراحی کاراکتر شیت (Character Sheet) لباس و چهره اسپایدرمن در پلتفرم ChatGPT آغاز کرده و سپس با عبور از ترکینگهای حرکتی Google Flow، او را در دو سکانس خیرهکننده (یک پرده معرفی داستانی و یک پرده اکشن بلاکباستری در قلب پایتخت) کارگردانی خواهیم کرد.
چرا دنیای عنکبوتی به هوش مصنوعی مولد نیاز دارد؟
صنعت تولید محتوای ویدیویی و سینمایی با ورود الگوریتمهای هوش مصنوعی دچار یک تحول بنیادین شده است. پیش از این، بزرگترین چالش آرتدایرکتورها در فرآیند ساخت کاراکتر با هوش مصنوعی، حفظ پایداری فیزیکی یا همان ثبات بصری (Character Consistency) شخصیت در فریمها و زوایای مختلف بود. در مدلهای قدیمی، به محض اینکه زاویه دوربین تغییر میکرد، جزییات لباس، ماسک یا چهره اسپایدرمن کاملاً دگرگون میشد و این مسئله خروجی کار را غیرحرفهای جلوه میداد. اما امروز به لطف تکنیکهای مهندسی پرامپت و ابزارهای پیشرفتهای که ما در این راهنما معرفی میکنیم، شما میتوانید تاروپود و جزییات لباس اسپایدرمن خود را در تمام زوایا کاملاً ثابت نگه داشته و پایداری فریمها را در جریان یک ترنزیشن سریع اکشن حفظ کنید.
گام اول: طراحی کاراکتر شیت حرفهای اسپایدرمن در ChatGPT
برای شروع هر پروژه سینمایی در دنیای عنکبوتی، ابتدا به یک سند مرجع یا همان کاراکتر شیت نیاز دارید. این برگه به منزله شناسنامه فیزیکی اسپایدرمن شماست که جزییات لباس، بافت تارها، لوگوی روی سینه، فرم ماسک و چهره بدون ماسک او را در زوایای مختلف ثبت میکند. پلتفرم چتجیپتی با مجهز شدن به مدلهای قوی فهم تصویر، بهترین گزینه برای این فاز است.
ابتدا وارد وبسایت چتجیپتی (ChatGPT) شوید. در بخش کادر متنی، روی آیکون پلاس (+) یا دکمه آپلود تصویر کلیک کنید و تصویر مرجع یا هر طرح اولیهای که از کاراکتر اسپایدرمن مد نظر دارید را بارگذاری نمایید. این تصویر بیس و پایه الگوریتم خواهد بود. سپس برای دریافت یک خروجی چندبعدی، استاندارد و بدون نقص، پرامپت مهندسیشده زیر را وارد کنید.


پرامپت اختصاصی ساخت کاراکتر شیت اسپایدرمن
دستور زیر را دقیقاً کپی کرده و در چتجیپیتی بنویسید تا جزییات فیزیکی شخصیت عنکبوتی شما را استخراج کند:
از این شخص یک کاراکتر شیت (Character Sheet) حرفهای و سینمایی از یک ابرقهرمان عنکبوتی (Spider-Man/Spider-Hero) تهیه کن که شامل موارد زیر باشد: - چندین نمای نزدیک (Close-up) از چهره با ماسک و بدون ماسک اسپایدرمن در زوایای مختلف. - چندین نمای تمامقد (Full Body) از زوایای مختلف (روبرو، سهرخ، نیمرخ و پشت) با لباس مخصوص ابرقهرمانی عنکبوتی. - حالت بدن و چهره کاملاً طبیعی، مصمم و خنثی باشد. - پسزمینه ساده، خنثی و بدون هیچ عنصر اضافی باشد تا تمام تمرکز روی جزئیات لباس و شخصیت قرار گیرد. - تمام نماها از نظر ظاهر، متریال لباس، لوگوی عنکبوت، چهره و جزئیات کاملاً یکدست و سازگار باشد.


پس از ارسال این پرامپت، هوش مصنوعی شروع به رندر یک تابلوی چندنمایی استاندارد از اسپایدرمن شما میکند. اگر در اولین تلاش به فرم ایدهآل لباس یا ترکیب چهره نرسیدید، نگران نباشید؛ ذات کار با هوش مصنوعی مبتنی بر تکرار و بهینهسازی است. دکمه بازتولید را بزنید یا المانهای لباس (مثل رنگ تارهای روی لباس یا جنس پارچه) را با پیامهای تکمیلی اصلاح کنید تا کاراکتر شیت نهایی کاملاً آماده شود. سپس تصویر را با کیفیت بالا ذخیره کنید.


گام دوم: ورود به Google Flow و متحرکسازی دنیای عنکبوتی
پس از نهایی شدن ساخت کاراکتر با هوش مصنوعی در فاز ایستا، نوبت به تزریق حرکت و روح به این کانسپت میرسد. وبسایت Google Flow یکی از تخصصیترین موتورهای هوش مصنوعی در حوزه تبدیل عکس به ویدیو (Image-to-Video) است که در حفظ ارگونومی اندامها و ترکینگ فیزیک حرکتی فوقالعاده عمل میکند. در این بخش ما کاراکتر شیت اسپایدرمن خود را به دو پرده و دو اتمسفر کاملاً متفاوت دعوت میکنیم تا یک مینیمووی جذاب بسازیم.






پرده اول: سکانس سخنگو و ترنزیشن سقوط اسپایدرمن از پنجره اتاق
در پنل کاربری سایت Google Flow، به بخش آپلود تصویر مرجع رفته و کاراکتر شیتی که در گام قبلی از چتجیپتی گرفتید را بارگذاری کنید. در این صحنه، ما میخواهیم هویت پنهان اسپایدرمن را در اتاق یک نوجوان به تصویر بکشیم که درست قبل از پوشیدن کامل لباس، پیامی را به زبان فارسی به مخاطب منتقل کرده و با یک سقوط ناگهانی، اکشن خود را آغاز میکند.


پرامپت ساخت ویدیو سخنگوی اسپایدرمن (صحنه اول)
پرامپت انگلیسی زیر را دقیقاً در بخش دستور متنی ویدیو در Google Flow وارد کنید:
This Spider-Man character, appearing as a young hero, is sitting in the center of a wide window sill, inside a teenager's cluttered bedroom filled with superhero sketches and gear. The frame is filled by a large window showing a view of a city skyline with red brick buildings under soft, overcast daylight. Movement Sequence: The character is initially seen at the start of the scene (<<<image_1>>>) sitting on the window sill in his casual clothes combined with parts of his spider-suit, looking out of the frame in a profile view. Then, he slowly turns his head and body toward the camera to look directly into the lens. With a natural smile, he faces the camera and speaks in Persian with accurate lip synchronization (Accurate Persian Lip Sync), saying: "حالا که تابستونه، بریم یکم خوش بگذرونیم." After speaking, he raises his hand to show a peace sign (✌️), then lift both hands above his head to place a pair of over-ear headphones onto his ears. In the end, he suddenly lets his body fall backward, plunging out of the window as a true Spider-hero. Camera: The camera is completely stationary (Locked-off); a wide shot at eye level, perfectly symmetrical and centered on the window. There is no panning, tilting, zooming, or camera angle changes. Style: Cinematic indie film aesthetic with a slightly desaturated color palette, natural and soft window lighting, shallow depth of field, 35mm film grain texture, and a music video-like energy. The background buildings visible through the window are softly blurred.
پرامپت فارسی
پرامپت ساخت ویدیو سخنگو اول:
این شخص در مرکز یک طاقچهی عریض پنجره، داخل اتاقخواب شلوغ یک نوجوان نشسته است. قاب تصویر توسط یک پنجرهی بزرگ پر شده که منظرهای از خط آسمان شهری با ساختمانهای آجری قرمز را در زیر نور ملایم و ابری روز نشان میدهد.
توالی حرکت:
شخص در ابتدای صحنه (<<<image_1>>>) در حالی که روی طاقچه نشسته و از زاویهی نیمرخ به سمتی خارج از کادر نگاه میکند دیده میشود. سپس بهآرامی سر و بدنش را به سمت دوربین میچرخاند و مستقیماً به دوربین نگاه میکند. بعد با لبخندی طبیعی، رو به دوربین و به زبان فارسی با همگامسازی دقیق لبها (Accurate Persian Lip Sync) میگوید:«حالا که تابستونه، بریم یکم خوش بگذرونیم.»
پس از گفتن این جمله، دست خود را بالا آورده و علامت صلح (✌️) را نشان میدهد. سپس هر دو دستش را بالای سر میبرد و یک هدفون روگوشی را روی گوشهایش قرار میدهد. در پایان، ناگهان بدنش را به عقب رها کرده و از پنجره به بیرون سقوط میکند.
دوربین:
دوربین کاملاً ثابت (Locked-off) است؛ یک نمای باز (Wide Shot) در ارتفاع چشم، کاملاً متقارن و در مرکز پنجره قرار دارد. هیچ حرکت پن، تیلت، زوم یا تغییر زاویهای وجود ندارد.استایل:
حالوهوای یک فیلم مستقل سینمایی (Cinematic Indie Film) با رنگبندی کمی بیروح و کماشباع (Slightly Desaturated)، نور طبیعی و نرمِ پنجره، عمق میدان کم، بافت فیلم ۳۵ میلیمتری و انرژی شبیه موزیکویدیو. ساختمانهای پسزمینه که از داخل پنجره دیده میشوند، در
تنظیمات حیاتی منوی Settings برای صحنه اول
پیش از فشردن دکمه رندر، منوی تنظیمات (Settings) پلتفرم را باز کرده و پارامترها را دقیقاً طبق ساختار زیر ست کنید تا خروجی شما فاقد دفرمه شدن بافت لباس و چهره باشد:
- تعداد خروجی (Output Count): مقدار را روی 1 بگذارید تا اولین تست و رندر به صورت متمرکز و با بالاترین پهنای باند پردازشی انجام شود.
- مدت زمان ویدیو (Duration): این بخش را متناسب با زمان دیالوگ و حرکت سقوط، بین 5 تا 10 ثانیه تنظیم کنید.
- ابعاد ویدیو (Aspect Ratio): حالت عمودی (Vertical – 9:16) را انتخاب کنید تا ویدیو برای بخش ریلز اینستاگرام، تیکتاک و شورتز یوتیوب نیازی به کراپ نداشته باشد.
- انتخاب مدل پردازش (Model Type): گزینه را روی حالت Omni قرار دهید تا سیستم بهترین درک را از فیزیک حرکت و آناتومی بدن کاراکتر عنکبوتی داشته باشد.
- حالت یکپارچهسازی (Integrated): حتماً روی حالت Integrated بگذارید تا همگامسازی دیالوگ فارسی (Lip Sync) با حرکت لبهای کاراکتر اسپایدرمن کاملاً دقیق اعمال شود.
پس از تایید تنظیمات، روی دکمه Generate کلیک کنید و منتظر بمانید تا سیستم پردازش سنگین ابری خود را روی صحنه اول به پایان برساند.


پرده دوم: سکانس اکشن سینمایی اسپایدرمن در بستر شهری تهران
اکنون نوبت به جذابترین بخش ماجرا میرسد؛ جایی که تارهای اسپایدرمن به بتن ساختمانهای پایتخت گره میخورند. در این بخش، ما دوباره تصویر کاراکتر شیت چتجیپتی را در Google Flow بارگذاری میکنیم تا پایداری و ثبات لباس و ماسک کاراکتر در فریمهای اکشن حفظ شود. منوی تنظیمات فنی را دقیقاً مشابه مرحله قبل (Output: 1, Duration: 10s, Aspect Ratio: Vertical, Model: Omni, Integrated: Active) تنظیم کنید.
پرامپت فوقپیشرفته پرواز اسپایدرمن میان ترافیک تهران (صحنه دوم)
این پرامپت انگلیسی با دقت هندسی بالا، تعامل فیزیکی اسپایدرمن با خودروهای ایرانی و نمادهای تهران مانند برج میلاد را شبیهسازی میکند:
CHARACTER REFERENCE — REQUIRED: Face and Spider-Man Suit — . Keep the exact same person, spider-suit, and styling shown in across every frame. BODY + PHYSICALITY — REQUIRED: Tall athletic male build, 188cm and 90kg, lean and powerful Spider-Man physique. Full muscular control at all times. Core braced, every movement precise and intentional. Parkour-trained, gymnast-level control. No floating, no rag-doll motion. CONTACT WITH CITY — REQUIRED: Constant physical interaction with environment — pushing off concrete, grabbing ledges, running along walls, landing on Iranian cars. Every impact has real weight and muscle response. Grounded physics only. TEHRAN CITY ENVIRONMENT — REQUIRED: The entire scene is set in Tehran, Iran. Visible landmarks include Milad Tower (Borj-e Milad) in the background skyline. Streets are authentic Tehran urban streets: dense traffic, concrete buildings, Persian signage, overhead wires, real city texture. Vehicles include Saipa Pride (Pride), Samand taxis (yellow taxis common in Tehran), and other typical Iranian city cars. Street atmosphere feels real, modern Tehran — not stylized Western city. PEOPLE IN SCENE — REQUIRED: If pedestrians appear, they are well-dressed, stylish young Iranian men and women, modern street fashion, clean and cinematic look, natural and confident presence. No stereotypes, no exaggeration, realistic urban crowd energy. POSTURE PER MOVE — REQUIRED: Swing: arms extended on web lines, legs tight, athletic form. Wall run: 45° lean on concrete buildings, rhythmic foot strikes. Push-off: deep knee compression → explosive launch into the air. Apex: open relaxed body, floating web-control. Sprint: forward lean, fast cadence, strong arm drive between cars. LOOK — REQUIRED: Photoreal cinematic realism, large-format anamorphic lens, authentic motion blur, natural fabric physics of the spider-suit, Tehran haze, golden-hour lighting. CAMERA — REQUIRED: Single continuous aerial follow-cam, wide framing, no cuts, camera tilts and rolls with motion, always tracking the swinging Spider-Man subject. 10-SECOND SEQUENCE — TEHRAN VERSION 0–1s: Spider-Man is already mid-air above Tehran city blocks. Milad Tower visible in far background skyline. Golden light over dense urban fabric. He fires a web line upward from between concrete buildings. 1–3s: Low swing over Tehran street. Below him: traffic of Saipa Pride cars and yellow Samand taxis. He swings at rooftop level, briefly brushing over a car roof — real contact, energy transfer. Camera tilts with motion. 3–6s: He releases into a Tehran building wall run — concrete façade, Persian signage. Feet strike in rhythm, body angled 45°. 4–5 steps → explosive push-off → new web line fires across intersection. Camera rolls dynamically. 6–8s: Drops into busy Tehran street. Yellow taxis and Pride cars passing close. He sprints between vehicles, weaving through traffic. One step hits a taxi roof → instant upward launch. 8–10s: Rooftop-level arc with Milad Tower clearly behind him. He floats briefly in golden sky, centered silhouette above Tehran skyline. Rooftops, antennas, and city density below. He holds a moment of calm, then begins to descend. EMOTION + AUDIO — REQUIRED: Fully alive, focused, adrenaline-driven. Joy in motion. Real laugh in street sequence. AUDIO (NO MUSIC): Wind rush, web snap, tire noise, Persian city ambience, traffic horns, distant Tehran street soundscape, breathing, impacts on metal/concrete.

نمونه ویدئو ساخت کاراکتر اسپایدر من با هوش مصنوعی
تدوین و نهاییسازی دنیای عنکبوتی بومی در کپکات (CapCut)
پس از پایان رندرهای شگفتانگیز در پلتفرم Google Flow، شما دو فایل ویدیویی عمودی در اختیار دارید که رشته اتصال آنها کاراکتر اسپایدرمن شماست. برای پیوند زدن این دو بخش، ویدیوها را وارد یک نرمافزار تدوین مانند کپکات (CapCut)، اینشات یا پریمیر کنید. از آنجا که سکانس اول دقیقاً در لحظه سقوط کاراکتر از پنجره به پایان میرسد، میتوانید فریم شروع سکانس دوم (معلق بودن اسپایدرمن در آسمان تهران) را بلافاصله پس از آن کات بزنید. برای جذابیت بیشتر، یک افکت موشن بلر (Motion Blur) یا ترنزیشن سرعت (Speed Ramp) روی نقطه سقوط اعمال کنید. در نهایت، با صداگذاری هوشمندانه یعنی تلفیق صدای شلیک تار (Web Snap)، وزش باد شدید و بوقهای نمادین ترافیک تهران، یک اثر ابرقهرمانی بومی خلق کنید که در فضاهای مجازی پتانسیل بالایی برای وایرال شدن دارد.
خلق فانتزیهای نو با ابزارهای نوین پردازش کاراکتر
مسیر طراحی و ساخت کاراکتر با هوش مصنوعی دریچهای رو به بینهایت ایده خلاقانه است که پیش از این نیاز به بودجههای میلیون دلاری استودیوهای بزرگ داشت. پلتفرمهایی مانند ChatGPT و ابزارهای متحرکسازی ویدیویی به شما این امکان را میدهند که سنتشکنی کرده و کاراکترهای بزرگ جهانی را در بسترهای فرهنگی و شهری خودمان بازآفرینی کنید. تکنیک پرامپتنویسی دقیق و رعایت اصول حفظ ثبات چهره و لباس، کلید اصلی شما برای ورود به بازار کار نوین تولید محتوای هوش مصنوعی است. همین امروز کاراکتر عنکبوتی اختصاصی خود را بسازید و تهران را به زمین بازی او تبدیل کنید.




