גוגל לומייר: עתיד יצירת וידאו ריאליסטי בעזרת בינה מלאכותית

  • הוא משתמש בארכיטקטורת Space-Time-U-Net כדי ליצור סרטונים שלמים בשלב אחד, תוך הימנעות מעיוותים חזותיים.
  • זה מאפשר לך ליצור סרטונים מטקסט, להנפיש תמונות סטטיות ולבצע עריכות מדויקות לאובייקטים בקליפים קיימים.
  • זה מתגבר על המגבלות של יצירת פריים אחר פריים, ומשיג קוהרנטיות זמנית וזרימה של תנועה מעולים.
  • הוא נמצא כעת בשלב הניסויים והמחקר, ללא גישה לציבור הרחב מסיבות בטיחותיות ואתיות.

בינה מלאכותית וידאו

האם אי פעם עצרתם וחשבתם כמה מדהים יהיה לכתוב שורת טקסט פשוטה, ובמצמוץ עין, לקבל מולכם סרטון פוטוריאליסטי וקוהרנטי ? זה לא מדע בדיוני; זוהי ההבטחה של גוגל לומייר, מודל בינה מלאכותית שעושה מהפכה ביצירה חזותית באמצעות טכנולוגיה חדשנית הנקראת דיפוזיה מרחבית-זמנית . עבור כל מי שעובד במגזר הטכנולוגיה או פשוט מוקסם מחדשנות, הבנת הקפיצה הזו היא המפתח להישאר צעד אחד קדימה בנוף הדיגיטלי של ימינו.

בניגוד לאמונה הרווחת, אנחנו לא מדברים על תוכנה שמוסיפה פשוט תנועה לתמונות סטטיות. אנחנו עוסקים בארכיטקטורה שתוכננה מלכתחילה כדי להבין את הפיזיקה של תנועת עצמים בזמן ובמרחב כאחד. פרויקט זה, שנוצר במעבדות של גוגל, נולד במטרה מפורשת לחסל את הקפיצות הפתאומיות והתנועות המוזרות שעד כה גרמו לסרטונים שנוצרו על ידי בינה מלאכותית להיראות סוריאליסטיים במקצת.

מהו בעצם הקסם של לומייר?

הבעיה הגדולה ביותר עם וידאו מבוסס בינה מלאכותית גנרטיבית הייתה חוסר העקביות שלו. לעתים קרובות ניתן היה לראות אובייקטים משנים צורה או מתעוותים משנייה לשנייה. Lumiere פותרת זאת על ידי עיבוד כל המידע בו זמנית , ובכך מונעת מהבינה המלאכותית "לשכוח" איך נראה הפריים הראשון עד הפריים העשירי. זה מבטיח יציבות ויזואלית מוחלטת : אם חתול רץ בגינה, הוא יישאר אותו חתול לאורך כל הסרטון, מבלי להפוך למשהו אחר באמצע.

האלמנט הטכני המרכזי טמון במערכת Space-Time-U-Net (STUNet) . בעוד שרוב הכלים המסורתיים יוצרים וידאו פריים אחר פריים (בסגנון אנימציה קלאסי), Lumiere מייצרת את כל הרצף בשלב אחד . גישה זו מאפשרת תנועה זורמת וטבעית, כאשר המודל מנתח פיקסלים וזמן בו זמנית, תוך הבנה של מושגי פיזיקה בסיסיים כמו זרימת מים או משקל של עצמים נופלים.

יכולות יצירתיות וכלי עריכה

האפשרויות למחלקות קריאייטיב הן, למען האמת, מדהימות. אחת התכונות הבולטות שלה היא טקסט-לווידאו , שבו תיאור פשוט של סצנה מפורטת מספיק כדי שהבינה המלאכותית תחיה אותה. אבל זה לא נעצר שם; היא יכולה גם להנפיש תמונות , ולהפוך תמונה סטטית לסרטון שבו עננים נעים או נהר זורם בטבעיות מוחלטת.

יתר על כן, Lumiere מצטיינת בפוסט-פרודקשן אוטומטי. היא מאפשרת צביעה פנימית ועריכה סלקטיבית באמצעות פקודות טקסט. לדוגמה, ניתן לבקש ממנה לשנות רק את צבע הבגדים של אדם בסרטון שהוקלט בעבר, או להוסיף אביזרים כמו משקפיים או כתרים, תוך שמירה על שאר הסצנה שלמה ועקבית לחלוטין . היא אפילו מאפשרת ליצור סינמגרפים, תוך אנימציה של אזור ספציפי בלבד בתמונה בעוד שהשאר נשאר סטטי.

ניתוח טכני וביצועים

מבחינת מספרים, המערכת מסוגלת לייצר קליפים בני כחמש שניות , לייצר 80 פריימים בקצב של 16 פריימים לשנייה וברזולוציה של 1.024 x 1.024 פיקסלים. למרות שגוגל מסווגת את התוצאות הללו כ"רזולוציה נמוכה", הריאליזם במרקמי העור, עבודות המתכת והתאורה הדינמית בולט. כדי להשיג זאת, המודל אומן על פריסה מסיבית של 30 מיליון סרטונים בליווי תיאורי טקסט.

השוואה עם התחרות והזמינות

בהשוואה לחברות ענק אחרות, צצים ניואנסים מעניינים. בעוד ש- Sora של OpenAI בולטת ביצירת קליפים ארוכים יותר, Lumiere מתמקדת ביעילות הארכיטקטורה בשלב אחד שלה ובדיוק העריכה שלה. בהשוואה ל- Runway או Pika , ההיצע של גוגל נוטה לכיוון ריאליזם צילומי וטכני יותר, אידיאלי לסביבות מקצועיות ושיווקיות, ומתרחקת במידה מסוימת מסגנונות פנטסטיים יותר.

עכשיו, הנה הקאץ': זה לא פתוח לציבור הרחב. כרגע זה פרויקט מחקר בתחום הבדיקות המבוקרות. גוגל נזהרת מאוד עם ההשקה כדי לחדד את מסנני האבטחה ולמנוע יצירת דיפפייקס או מידע שגוי . שמועות מצביעות על כך שתכונות מסוימות עשויות להשתלב בסופו של דבר ביוטיוב או ב-Google Workspace בעתיד הקרוב.

ההשפעה על התעשייה והאתיקה

פריסת הטכנולוגיה הזו תביא לשינוי רדיקלי בתעשיית הקולנוע, ותאפשר לבמאים לצפות בסצנות בזול מאוד לפני הצילומים. בשיווק, מותגים יוכלו לייצר באופן אוטומטי פרסומות היפר-מותאמות אישית. עם זאת, כוח זה מגיע עם אחריות עצומה, מה שמאלץ את התעשייה ליצור סימני מים ומערכות אימות כדי להבחין בין האמיתי למה שנוצר באופן מלאכותי.

מודל זה, המעניק כבוד לחלוצי הקולנוע, האחים לומייר, מסמן נקודת מפנה שבה היצירתיות אינה מוגבלת עוד על ידי אילוצים טכניים . היכולת להבין תלת-ממד וזמן בתוך רשת נוירונים אחת מקרבת אותנו לעתיד שבו המחסום בין דמיון לביצוע חזותי נעלם כמעט לחלוטין, ומשנה את האופן שבו אנו מספרים סיפורים בעידן הדיגיטלי.


הוסף כמקור מועדף בגוגל