آشنایی با ابزارهای مولد تصویر، صوت و ویدئو

مدرس: دکتر مهدیه سلیمانی دوره: هوش مصنوعی
زمان ارائه: دوشنبه ۱۷:۰۰ تا ۲۰:۰۰ گواهی‌نامه: رسمی

هدف کلی

هدف این درس آشنایی دبیران با مفاهیم پایه، قابلیت‌ها و کاربردهای هوش مصنوعی در پردازش، درک، تولید و ویرایش محتوای چندرسانه‌ای است. فراگیر پس از پایان این درس:

  • با نحوه نمایش و پردازش تصویر، صوت و ویدئو در رایانه آشنا می‌شود.
  • قابلیت‌ها و محدودیت‌های مدل‌های هوش مصنوعی در درک و تولید محتوای چندرسانه‌ای را می‌شناسد.
  • می‌تواند با استفاده از ابزارهای هوش مصنوعی، تصاویر، فایل‌های صوتی و ویدئوهای آموزشی تولید و ویرایش کند.

سرفصل‌ها

  1. آشنایی با داده‌های رسانه‌ای: تصویر، صوت و ویدئو
    • انواع داده‌های رسانه‌ای و تبدیل پدیده‌های واقعی به داده عددی
    • نمایش تصویر به‌صورت پیکسل و کانال‌های رنگی
    • نمایش صوت به‌صورت سیگنال زمانی و مفاهیم نمونه‌برداری و عمق بیت
    • ویدئو به‌عنوان دنباله‌ای از فریم‌ها به همراه صوت
    • وضوح، نرخ فریم، حجم داده، فشرده‌سازی، قالب فایل، Codec و Container
  2. پردازش، درک و تولید محتوای رسانه‌ای
    • تفاوت پردازش، درک و تولید در هوش مصنوعی
    • پردازش برای بهبود یا اصلاح داده موجود
    • درک برای استخراج معنا و اطلاعات از رسانه
    • تولید برای ساخت محتوای رسانه‌ای جدید
  3. پردازش و ویرایش تصویر، صوت و ویدئو
    • پردازش تصویر؛ تغییر روشنایی و کنتراست، حذف نویز، افزایش وضوح و بهبود کیفیت
    • حذف، افزودن، جایگزینی و تغییر عناصر تصویر با دستور متنی
    • تغییر سبک، پس‌زمینه و گسترش کادر تصویر
    • پردازش صوت؛ حذف نویز، بهبود وضوح گفتار و تنظیم کیفیت صدا
    • جداسازی گفتار، موسیقی و صداهای محیطی
    • پردازش ویدئو؛ کاهش نویز، اصلاح نور، تثبیت حرکت و بهبود هماهنگی صوت و تصویر
  4. درک تصویر، صوت و ویدئو
    • دسته‌بندی تصویر و آشکارسازی اشیا
    • توصیف تصویر به متن و پرسش‌وپاسخ درباره تصویر
    • تبدیل گفتار به متن و تحلیل محتوای صوت
    • پرسش‌وپاسخ درباره محتوای صوت و استفاده از زمان یا قطعه شاهد
    • تشخیص فعالیت‌ها و رویدادها در ویدئو
    • توصیف، خلاصه‌سازی، فصل‌بندی و پرسش‌وپاسخ درباره ویدئو
    • کاربرد در دسترس‌پذیری، جست‌وجوی رسانه‌ای و استخراج محتوای آموزشی
  5. تولید و ویرایش تصویر با هوش مصنوعی
    • تولید تصویر از توضیح متنی
    • تولید تصاویر علمی، آموزشی، داستانی و اینفوگرافیک
    • شخصی‌سازی تصاویر متناسب با درس، پایه و سطح دانش‌آموز
    • ویرایش تصویر موجود با دستور متنی
    • حذف، افزودن یا جایگزینی عناصر و تغییر سبک و ترکیب‌بندی
    • بازبینی صحت علمی و مناسب‌بودن تصاویر پیش از استفاده آموزشی
  6. تولید صوت و محتوای شنیداری با هوش مصنوعی
    • تبدیل متن به گفتار و کنترل صدا، لحن، سرعت، مکث و تلفظ
    • تولید گویندگی و راهنمای صوتی برای محتوای آموزشی
    • تولید پادکست و گفت‌وگوی آموزشی چندگوینده
    • تولید تمرین شنیداری و مکالمه برای آموزش زبان
    • تولید موسیقی و پس‌زمینه صوتی با تعیین سبک، سازبندی، ریتم و ساختار
    • بازبینی تلفظ، کیفیت و تناسب محتوای صوتی
  7. تولید ویدئو با هوش مصنوعی
    • تولید ویدئو از متن و تصویر مرجع
    • توصیف سوژه، کنش، حرکت دوربین، مدت، سبک و نسبت تصویر
    • طراحی چند شات، Storyboard و حفظ ثبات شخصیت و صحنه
    • تولید آواتار آموزشی و ویدئوی ارائه با مجری مجازی
    • تولید انیمیشن و فیلم کوتاه آموزشی
    • تبدیل اسلاید، PDF یا ارائه موجود به ویدئوی آموزشی
    • افزودن گویندگی، موسیقی، زیرنویس و تدوین نهایی
    • آشنایی با محدودیت‌های تولید حرکت، ثبات اشیا و روابط زمانی و علّی
  8. مهندسی درخواست برای تصویر، صوت و ویدئو
    • تعیین هدف، مخاطب، محتوا، سبک و محدودیت‌ها
    • نوشتن درخواست دقیق و قابل ارزیابی به‌جای دستورهای کلی
    • مشخص‌کردن سوژه، زمینه، ترکیب‌بندی، نور، رنگ و نسبت تصویر در پرامپت تصویری
    • مشخص‌کردن متن، گوینده، لحن، سرعت، زبان و تلفظ در پرامپت صوتی
    • مشخص‌کردن کنش، حرکت، دوربین، زمان و قالب در پرامپت ویدئویی
    • استفاده از تصویر یا رسانه مرجع برای هدایت بهتر خروجی
    • اصلاح مرحله‌ای درخواست و تغییر یک عامل در هر مرحله
    • استفاده از قیود و موارد ممنوع برای کنترل بهتر خروجی
  9. آشنایی و انتخاب ابزارهای هوش مصنوعی برای محتوای رسانه‌ای
    • انتخاب ابزار بر اساس سه وظیفه تولید، ویرایش و درک محتوا
    • آشنایی با ابزارهای تولید و ویرایش تصویر
    • آشنایی با ابزارهای تولید، پاک‌سازی و ویرایش صوت
    • آشنایی با ابزارهای تولید و ویرایش ویدئو و آواتار
    • آشنایی با ابزارهای چندوجهی برای درک تصویر، صوت و ویدئو
    • توجه به سادگی استفاده، پشتیبانی از زبان فارسی، حریم خصوصی و امکان بازبینی خروجی
  10. ارزیابی، راستی‌آزمایی و استفاده مسئولانه از محتوای رسانه‌ای
    • ارزیابی صحت، ارتباط، انسجام و قابلیت استفاده آموزشی خروجی
    • معیارهای اختصاصی ارزیابی تصویر، صوت و ویدئو
    • شناسایی توهم، جزئیات ساختگی و خطاهای علمی یا تاریخی
    • استفاده از شواهد و منابع مستقل برای راستی‌آزمایی خروجی
    • شناسایی سوگیری و بررسی انصاف در گروه‌ها و شرایط مختلف
    • رعایت حقوق مالکیت فکری، مجوز استفاده و شرایط ابزارها
    • حفاظت از چهره، صدا و سایر اطلاعات شخصی دانش‌آموزان
    • رعایت شفافیت در استفاده از محتوای تولیدشده یا ویرایش‌شده با هوش مصنوعی
    • دریافت رضایت مناسب در استفاده از آواتار، شبیه‌سازی چهره یا شبیه‌سازی صدا
  11. کاربردهای آموزشی هوش مصنوعی در محتوای چندرسانه‌ای
    • ساخت زیرنویس، متن جایگزین و محتوای دسترس‌پذیر
    • تبدیل ضبط کلاس یا سخنرانی به متن، خلاصه و محتوای قابل جست‌وجو
    • تولید سؤال و فعالیت آموزشی از روی تصویر، صوت و ویدئو
    • تولید تصاویر، نمودارها، اینفوگرافیک‌ها، کاربرگ‌ها و پوسترهای آموزشی
    • تولید پادکست، راهنمای صوتی و تمرین‌های شنیداری
    • تولید ویدئوهای کوتاه، انیمیشن و آواتار برای توضیح و مرور درس
    • فصل‌بندی و خلاصه‌سازی ویدئوهای آموزشی
    • شخصی‌سازی محتوای دیداری و شنیداری برای دانش‌آموزان با نیازها و سطوح مختلف

ارزیابی

  • آزمون‌های چندگزینه‌ای پایان هر بخش
  • تمرین‌های مرتبط با کار با ابزارها
  • آزمون پایانی

منابع

  1. Ian Goodfellow, Yoshua Bengio and Aaron Courville, Deep Learning, Book in preparation for MIT Press, 2016.
  2. Michael Nielsen, Neural networks and deep learning, Preprint, 2016.