آشنایی با ابزارهای مولد تصویر، صوت و ویدئو
| مدرس: دکتر مهدیه سلیمانی | دوره: هوش مصنوعی |
| زمان ارائه: دوشنبه ۱۷:۰۰ تا ۲۰:۰۰ | گواهینامه: رسمی |
هدف کلی
هدف این درس آشنایی دبیران با مفاهیم پایه، قابلیتها و کاربردهای هوش مصنوعی در پردازش، درک، تولید و ویرایش محتوای چندرسانهای است. فراگیر پس از پایان این درس:
- با نحوه نمایش و پردازش تصویر، صوت و ویدئو در رایانه آشنا میشود.
- قابلیتها و محدودیتهای مدلهای هوش مصنوعی در درک و تولید محتوای چندرسانهای را میشناسد.
- میتواند با استفاده از ابزارهای هوش مصنوعی، تصاویر، فایلهای صوتی و ویدئوهای آموزشی تولید و ویرایش کند.
سرفصلها
- آشنایی با دادههای رسانهای: تصویر، صوت و ویدئو
- انواع دادههای رسانهای و تبدیل پدیدههای واقعی به داده عددی
- نمایش تصویر بهصورت پیکسل و کانالهای رنگی
- نمایش صوت بهصورت سیگنال زمانی و مفاهیم نمونهبرداری و عمق بیت
- ویدئو بهعنوان دنبالهای از فریمها به همراه صوت
- وضوح، نرخ فریم، حجم داده، فشردهسازی، قالب فایل، Codec و Container
- پردازش، درک و تولید محتوای رسانهای
- تفاوت پردازش، درک و تولید در هوش مصنوعی
- پردازش برای بهبود یا اصلاح داده موجود
- درک برای استخراج معنا و اطلاعات از رسانه
- تولید برای ساخت محتوای رسانهای جدید
- پردازش و ویرایش تصویر، صوت و ویدئو
- پردازش تصویر؛ تغییر روشنایی و کنتراست، حذف نویز، افزایش وضوح و بهبود کیفیت
- حذف، افزودن، جایگزینی و تغییر عناصر تصویر با دستور متنی
- تغییر سبک، پسزمینه و گسترش کادر تصویر
- پردازش صوت؛ حذف نویز، بهبود وضوح گفتار و تنظیم کیفیت صدا
- جداسازی گفتار، موسیقی و صداهای محیطی
- پردازش ویدئو؛ کاهش نویز، اصلاح نور، تثبیت حرکت و بهبود هماهنگی صوت و تصویر
- درک تصویر، صوت و ویدئو
- دستهبندی تصویر و آشکارسازی اشیا
- توصیف تصویر به متن و پرسشوپاسخ درباره تصویر
- تبدیل گفتار به متن و تحلیل محتوای صوت
- پرسشوپاسخ درباره محتوای صوت و استفاده از زمان یا قطعه شاهد
- تشخیص فعالیتها و رویدادها در ویدئو
- توصیف، خلاصهسازی، فصلبندی و پرسشوپاسخ درباره ویدئو
- کاربرد در دسترسپذیری، جستوجوی رسانهای و استخراج محتوای آموزشی
- تولید و ویرایش تصویر با هوش مصنوعی
- تولید تصویر از توضیح متنی
- تولید تصاویر علمی، آموزشی، داستانی و اینفوگرافیک
- شخصیسازی تصاویر متناسب با درس، پایه و سطح دانشآموز
- ویرایش تصویر موجود با دستور متنی
- حذف، افزودن یا جایگزینی عناصر و تغییر سبک و ترکیببندی
- بازبینی صحت علمی و مناسببودن تصاویر پیش از استفاده آموزشی
- تولید صوت و محتوای شنیداری با هوش مصنوعی
- تبدیل متن به گفتار و کنترل صدا، لحن، سرعت، مکث و تلفظ
- تولید گویندگی و راهنمای صوتی برای محتوای آموزشی
- تولید پادکست و گفتوگوی آموزشی چندگوینده
- تولید تمرین شنیداری و مکالمه برای آموزش زبان
- تولید موسیقی و پسزمینه صوتی با تعیین سبک، سازبندی، ریتم و ساختار
- بازبینی تلفظ، کیفیت و تناسب محتوای صوتی
- تولید ویدئو با هوش مصنوعی
- تولید ویدئو از متن و تصویر مرجع
- توصیف سوژه، کنش، حرکت دوربین، مدت، سبک و نسبت تصویر
- طراحی چند شات، Storyboard و حفظ ثبات شخصیت و صحنه
- تولید آواتار آموزشی و ویدئوی ارائه با مجری مجازی
- تولید انیمیشن و فیلم کوتاه آموزشی
- تبدیل اسلاید، PDF یا ارائه موجود به ویدئوی آموزشی
- افزودن گویندگی، موسیقی، زیرنویس و تدوین نهایی
- آشنایی با محدودیتهای تولید حرکت، ثبات اشیا و روابط زمانی و علّی
- مهندسی درخواست برای تصویر، صوت و ویدئو
- تعیین هدف، مخاطب، محتوا، سبک و محدودیتها
- نوشتن درخواست دقیق و قابل ارزیابی بهجای دستورهای کلی
- مشخصکردن سوژه، زمینه، ترکیببندی، نور، رنگ و نسبت تصویر در پرامپت تصویری
- مشخصکردن متن، گوینده، لحن، سرعت، زبان و تلفظ در پرامپت صوتی
- مشخصکردن کنش، حرکت، دوربین، زمان و قالب در پرامپت ویدئویی
- استفاده از تصویر یا رسانه مرجع برای هدایت بهتر خروجی
- اصلاح مرحلهای درخواست و تغییر یک عامل در هر مرحله
- استفاده از قیود و موارد ممنوع برای کنترل بهتر خروجی
- آشنایی و انتخاب ابزارهای هوش مصنوعی برای محتوای رسانهای
- انتخاب ابزار بر اساس سه وظیفه تولید، ویرایش و درک محتوا
- آشنایی با ابزارهای تولید و ویرایش تصویر
- آشنایی با ابزارهای تولید، پاکسازی و ویرایش صوت
- آشنایی با ابزارهای تولید و ویرایش ویدئو و آواتار
- آشنایی با ابزارهای چندوجهی برای درک تصویر، صوت و ویدئو
- توجه به سادگی استفاده، پشتیبانی از زبان فارسی، حریم خصوصی و امکان بازبینی خروجی
- ارزیابی، راستیآزمایی و استفاده مسئولانه از محتوای رسانهای
- ارزیابی صحت، ارتباط، انسجام و قابلیت استفاده آموزشی خروجی
- معیارهای اختصاصی ارزیابی تصویر، صوت و ویدئو
- شناسایی توهم، جزئیات ساختگی و خطاهای علمی یا تاریخی
- استفاده از شواهد و منابع مستقل برای راستیآزمایی خروجی
- شناسایی سوگیری و بررسی انصاف در گروهها و شرایط مختلف
- رعایت حقوق مالکیت فکری، مجوز استفاده و شرایط ابزارها
- حفاظت از چهره، صدا و سایر اطلاعات شخصی دانشآموزان
- رعایت شفافیت در استفاده از محتوای تولیدشده یا ویرایششده با هوش مصنوعی
- دریافت رضایت مناسب در استفاده از آواتار، شبیهسازی چهره یا شبیهسازی صدا
- کاربردهای آموزشی هوش مصنوعی در محتوای چندرسانهای
- ساخت زیرنویس، متن جایگزین و محتوای دسترسپذیر
- تبدیل ضبط کلاس یا سخنرانی به متن، خلاصه و محتوای قابل جستوجو
- تولید سؤال و فعالیت آموزشی از روی تصویر، صوت و ویدئو
- تولید تصاویر، نمودارها، اینفوگرافیکها، کاربرگها و پوسترهای آموزشی
- تولید پادکست، راهنمای صوتی و تمرینهای شنیداری
- تولید ویدئوهای کوتاه، انیمیشن و آواتار برای توضیح و مرور درس
- فصلبندی و خلاصهسازی ویدئوهای آموزشی
- شخصیسازی محتوای دیداری و شنیداری برای دانشآموزان با نیازها و سطوح مختلف
ارزیابی
- آزمونهای چندگزینهای پایان هر بخش
- تمرینهای مرتبط با کار با ابزارها
- آزمون پایانی
منابع
- Ian Goodfellow, Yoshua Bengio and Aaron Courville, Deep Learning, Book in preparation for MIT Press, 2016.
- Michael Nielsen, Neural networks and deep learning, Preprint, 2016.