آشنایی با ابزارهای مولد تصویر، صوت و ویدئو

مدرس: دکتر مهدیه سلیمانی دوره: هوش مصنوعی
زمان ارائه: دوشنبه ۱۷:۰۰ تا ۲۰:۰۰ گواهی‌نامه: رسمی

هدف کلی

هدف این درس آشنایی دبیران با مفاهیم پایه، قابلیت‌ها و کاربردهای هوش مصنوعی در پردازش، درک، تولید و ویرایش محتوای چندرسانه‌ای است. فراگیر پس از پایان این درس:

سرفصل‌ها

  1. آشنایی با داده‌های رسانه‌ای: تصویر، صوت و ویدئو
    • انواع داده‌های رسانه‌ای و تبدیل پدیده‌های واقعی به داده عددی
    • نمایش تصویر به‌صورت پیکسل و کانال‌های رنگی
    • نمایش صوت به‌صورت سیگنال زمانی و مفاهیم نمونه‌برداری و عمق بیت
    • ویدئو به‌عنوان دنباله‌ای از فریم‌ها به همراه صوت
    • وضوح، نرخ فریم، حجم داده، فشرده‌سازی، قالب فایل، Codec و Container
  2. پردازش، درک و تولید محتوای رسانه‌ای
    • تفاوت پردازش، درک و تولید در هوش مصنوعی
    • پردازش برای بهبود یا اصلاح داده موجود
    • درک برای استخراج معنا و اطلاعات از رسانه
    • تولید برای ساخت محتوای رسانه‌ای جدید
  3. پردازش و ویرایش تصویر، صوت و ویدئو
    • پردازش تصویر؛ تغییر روشنایی و کنتراست، حذف نویز، افزایش وضوح و بهبود کیفیت
    • حذف، افزودن، جایگزینی و تغییر عناصر تصویر با دستور متنی
    • تغییر سبک، پس‌زمینه و گسترش کادر تصویر
    • پردازش صوت؛ حذف نویز، بهبود وضوح گفتار و تنظیم کیفیت صدا
    • جداسازی گفتار، موسیقی و صداهای محیطی
    • پردازش ویدئو؛ کاهش نویز، اصلاح نور، تثبیت حرکت و بهبود هماهنگی صوت و تصویر
  4. درک تصویر، صوت و ویدئو
    • دسته‌بندی تصویر و آشکارسازی اشیا
    • توصیف تصویر به متن و پرسش‌وپاسخ درباره تصویر
    • تبدیل گفتار به متن و تحلیل محتوای صوت
    • پرسش‌وپاسخ درباره محتوای صوت و استفاده از زمان یا قطعه شاهد
    • تشخیص فعالیت‌ها و رویدادها در ویدئو
    • توصیف، خلاصه‌سازی، فصل‌بندی و پرسش‌وپاسخ درباره ویدئو
    • کاربرد در دسترس‌پذیری، جست‌وجوی رسانه‌ای و استخراج محتوای آموزشی
  5. تولید و ویرایش تصویر با هوش مصنوعی
    • تولید تصویر از توضیح متنی
    • تولید تصاویر علمی، آموزشی، داستانی و اینفوگرافیک
    • شخصی‌سازی تصاویر متناسب با درس، پایه و سطح دانش‌آموز
    • ویرایش تصویر موجود با دستور متنی
    • حذف، افزودن یا جایگزینی عناصر و تغییر سبک و ترکیب‌بندی
    • بازبینی صحت علمی و مناسب‌بودن تصاویر پیش از استفاده آموزشی
  6. تولید صوت و محتوای شنیداری با هوش مصنوعی
    • تبدیل متن به گفتار و کنترل صدا، لحن، سرعت، مکث و تلفظ
    • تولید گویندگی و راهنمای صوتی برای محتوای آموزشی
    • تولید پادکست و گفت‌وگوی آموزشی چندگوینده
    • تولید تمرین شنیداری و مکالمه برای آموزش زبان
    • تولید موسیقی و پس‌زمینه صوتی با تعیین سبک، سازبندی، ریتم و ساختار
    • بازبینی تلفظ، کیفیت و تناسب محتوای صوتی
  7. تولید ویدئو با هوش مصنوعی
    • تولید ویدئو از متن و تصویر مرجع
    • توصیف سوژه، کنش، حرکت دوربین، مدت، سبک و نسبت تصویر
    • طراحی چند شات، Storyboard و حفظ ثبات شخصیت و صحنه
    • تولید آواتار آموزشی و ویدئوی ارائه با مجری مجازی
    • تولید انیمیشن و فیلم کوتاه آموزشی
    • تبدیل اسلاید، PDF یا ارائه موجود به ویدئوی آموزشی
    • افزودن گویندگی، موسیقی، زیرنویس و تدوین نهایی
    • آشنایی با محدودیت‌های تولید حرکت، ثبات اشیا و روابط زمانی و علّی
  8. مهندسی درخواست برای تصویر، صوت و ویدئو
    • تعیین هدف، مخاطب، محتوا، سبک و محدودیت‌ها
    • نوشتن درخواست دقیق و قابل ارزیابی به‌جای دستورهای کلی
    • مشخص‌کردن سوژه، زمینه، ترکیب‌بندی، نور، رنگ و نسبت تصویر در پرامپت تصویری
    • مشخص‌کردن متن، گوینده، لحن، سرعت، زبان و تلفظ در پرامپت صوتی
    • مشخص‌کردن کنش، حرکت، دوربین، زمان و قالب در پرامپت ویدئویی
    • استفاده از تصویر یا رسانه مرجع برای هدایت بهتر خروجی
    • اصلاح مرحله‌ای درخواست و تغییر یک عامل در هر مرحله
    • استفاده از قیود و موارد ممنوع برای کنترل بهتر خروجی
  9. آشنایی و انتخاب ابزارهای هوش مصنوعی برای محتوای رسانه‌ای
    • انتخاب ابزار بر اساس سه وظیفه تولید، ویرایش و درک محتوا
    • آشنایی با ابزارهای تولید و ویرایش تصویر
    • آشنایی با ابزارهای تولید، پاک‌سازی و ویرایش صوت
    • آشنایی با ابزارهای تولید و ویرایش ویدئو و آواتار
    • آشنایی با ابزارهای چندوجهی برای درک تصویر، صوت و ویدئو
    • توجه به سادگی استفاده، پشتیبانی از زبان فارسی، حریم خصوصی و امکان بازبینی خروجی
  10. ارزیابی، راستی‌آزمایی و استفاده مسئولانه از محتوای رسانه‌ای
    • ارزیابی صحت، ارتباط، انسجام و قابلیت استفاده آموزشی خروجی
    • معیارهای اختصاصی ارزیابی تصویر، صوت و ویدئو
    • شناسایی توهم، جزئیات ساختگی و خطاهای علمی یا تاریخی
    • استفاده از شواهد و منابع مستقل برای راستی‌آزمایی خروجی
    • شناسایی سوگیری و بررسی انصاف در گروه‌ها و شرایط مختلف
    • رعایت حقوق مالکیت فکری، مجوز استفاده و شرایط ابزارها
    • حفاظت از چهره، صدا و سایر اطلاعات شخصی دانش‌آموزان
    • رعایت شفافیت در استفاده از محتوای تولیدشده یا ویرایش‌شده با هوش مصنوعی
    • دریافت رضایت مناسب در استفاده از آواتار، شبیه‌سازی چهره یا شبیه‌سازی صدا
  11. کاربردهای آموزشی هوش مصنوعی در محتوای چندرسانه‌ای
    • ساخت زیرنویس، متن جایگزین و محتوای دسترس‌پذیر
    • تبدیل ضبط کلاس یا سخنرانی به متن، خلاصه و محتوای قابل جست‌وجو
    • تولید سؤال و فعالیت آموزشی از روی تصویر، صوت و ویدئو
    • تولید تصاویر، نمودارها، اینفوگرافیک‌ها، کاربرگ‌ها و پوسترهای آموزشی
    • تولید پادکست، راهنمای صوتی و تمرین‌های شنیداری
    • تولید ویدئوهای کوتاه، انیمیشن و آواتار برای توضیح و مرور درس
    • فصل‌بندی و خلاصه‌سازی ویدئوهای آموزشی
    • شخصی‌سازی محتوای دیداری و شنیداری برای دانش‌آموزان با نیازها و سطوح مختلف

ارزیابی

منابع

  1. Ian Goodfellow, Yoshua Bengio and Aaron Courville, Deep Learning, Book in preparation for MIT Press, 2016.
  2. Michael Nielsen, Neural networks and deep learning, Preprint, 2016.