Ugrás a fő tartalomra

Prompt Engineering for Vision Models

Gyakorlati bevezetés a látásalapú modellek promptolásába és vezérlésébe képszegmentáláshoz, objektumfelismeréshez, képgeneráláshoz, in-paintinghez és személyre szabott képgeneráláshoz.

A kurzusról

A Prompt Engineering for Vision Models egy kezdő szintű rövid kurzus a DeepLearning.AI-tól, a Comet közreműködésével. Kiterjeszti a prompt engineeringet a szövegalapú modelleken túlra, és bemutatja, hogyan vezérelhetők a látásalapú modellek természetes nyelv, pixelkoordináták, határolókeretek, szegmentációs maszkok és generálási paraméterek segítségével. A tanulók olyan technológiákkal dolgoznak, mint a Meta Segment Anything modellje, az OWL-ViT, a Stable Diffusion és a DreamBooth, miközben felfedezik a képszegmentálást, objektumfelismerést, képgenerálást, in-paintinget, finomhangolást és a kísérletkövetést.

Kurzus megtekintése a szolgáltató webhelyén

Külső webhelyet nyit meg egy új lapon.

Tanulási eredmények

  • Megérteni, hogyan különbözik a promptolás a szöveges és látásalapú modellek között
  • Látásalapú modellek promptolása szöveggel, koordinátákkal és határolókeretekkel
  • Képgenerálási paraméterek, például guidance scale, erősség és következtetési lépések beállítása
  • Képszegmentációs modellek használata egy kép részeinek izolálására
  • Természetes nyelvű promptok használata zero-shot objektumfelismeréshez
  • Szegmentálás, objektumfelismerés és képgenerálás kombinálása in-paintinghez
  • Megérteni, hogyan szabhatja személyre a DreamBooth a diffúziós modellek kimeneteit
  • Kísérletkövetés használata a vizuális promptolás és hiperparaméter-konfigurációk összehasonlítására

Elsajátítható készségek

Prompt Engineering, Számítógépes látás, Multimodális promptolás, Képgenerálás, Képszegmentálás, Objektumfelismerés, Diffúziós modellek, Finomhangolás, In-painting, AI-személyre szabás, Kísérletkövetés

Tananyag

  • Bevezetés

    Bemutatja a vizuális prompt engineeringet és a kurzus céljait.

  • Áttekintés

    Elmagyarázza a kurzus során használt látásalapú modelleket, promptolási módszereket és munkafolyamatokat.

  • Képszegmentálás

    Felfedezi a képszegmentációs modellek promptolását pozitív és negatív koordinátákkal, valamint határolókeretekkel.

  • Objektumfelismerés

    Természetes nyelvű promptokat használ objektumfelismerő modellekkel objektumok lokalizálására és izolálására képeken belül.

  • Képgenerálás

    Felfedezi a diffúzióalapú képgenerálást és az olyan paramétereket, mint a guidance scale, az erősség és a következtetési lépések.

  • Finomhangolás

    Bemutatja a diffúziós modellek személyre szabását a DreamBooth segítségével, és bemutatja, hogyan biztosíthat a finomhangolás nagyobb kontrollt a generált képek felett.

  • Következtetés

    Áttekinti a kurzus során lefedett főbb vizuális prompt engineering technikákat és munkafolyamatokat.

Előfeltételek

  • Python-ismeret ajánlott
  • Nincs szükség haladó számítógépes látás szakértelemre

Célközönség

AI-tervezők, Fejlesztők, Prompt mérnökök, Kreatív technológusok, AI-tartalomkészítők, Számítógépes látás kezdők, Generatív AI-gyakorlók

Ideális ehhez

  • AI Designer tanulási utat követő tanulók
  • Multimodális AI felé terjeszkedő prompt mérnökök
  • Generatív képi alkalmazások iránt érdeklődő fejlesztők
  • Alkotók, akik meg akarják érteni az AI képgenerálás technikai alapjait
  • Python-felhasználók, akik most kezdik felfedezni a számítógépes látást és a diffúziós modelleket

Előnyök

  • Gyakorlati bevezetés a vizuális prompt engineeringbe
  • Többféle látásalapú modellt fed le, nem csak a képgenerálást
  • Gyakorlati kódpéldákat tartalmaz
  • Lefedi a szegmentálást, objektumfelismerést, képgenerálást és finomhangolást
  • Bemutatja a DreamBooth személyre szabást
  • Bemutatja a kísérletkövetést az iteratív vizuális promptoláshoz

Hátrányok

  • Python-tapasztalat ajánlott
  • Néhány lefedett modell és technika specifikus implementáció, nem pedig a modern látásrendszerek teljes körű áttekintése
  • A rövid formátum korlátozza a haladó számítógépes látáselmélet mélységét
  • Nem nyújt átfogó éles környezetbe történő telepítési képzést

Kurzusadatok

Szolgáltató:
DeepLearning.AI
Oktató:
Abby Morgan, Jacques Verré and Caleb Kaiser
Időtartam:
1 hour 22 minutes
Szint:
Kezdő
Nyelv:
English

Tanúsítvány és képzési forma

Tanúsítvány elérhető

Formátum: Online, Self-paced, Video lessons, Interactive code examples

Eszközök a kurzushoz

Kapcsolódó tanulási útvonalak

AI tartalomkészítő tanulási útvonal

Gyakorlati tanulási útvonal azoknak az alkotóknak, akik a mesterséges intelligenciát szeretnék használni a tartalomgyártás teljes folyamatában. Az útvonal lefedi a kutatást, az ötletelést, az írást, a vizuális alkotást, a videógyártást, a hanganyagokat, az újrahasznosítást, a szerkesztést, a minőségellenőrzést és a többformátumú közzétételi munkafolyamatokat.

AI-fejlesztői tanulási útvonal

Strukturált tanulási útvonal azon törekvő AI-fejlesztők számára, akik meg akarják érteni a modern AI-rendszereket és hasznos, AI-alapú alkalmazásokat szeretnének építeni. Az útvonal ötvözi az alapvető fogalmakat, a gyakorlati AI-eszközöket, a kódolási munkafolyamatokat, az irányított projekteket és a fejlesztési mérföldköveket.

AI-tervező tanulási útvonal

Gyakorlati tanulási útvonal tervezők, alkotók és vizuális szakemberek számára, akik integrálni szeretnék a mesterséges intelligenciát a modern tervezési munkafolyamatokba. Az útvonal lefedi a kreatív briefeket, a vizuális ötletelést, a képpromptolást, a generatív képi eszközöket, az elrendezés- és prezentációtervezést, a képjavítást, a konzisztenciát, a minőségellenőrzést és a portfóliófejlesztést.

Promptmérnök tanulási útvonal

Gyakorlati tanulási útvonal a promptmérnöki készségek fejlesztéséhez a modern AI-asszisztensek és munkafolyamatok területén. Az útvonal lefedi a prompt szerkezetét, a kontextus tervezését, a modell-összehasonlítást, a kimeneti korlátozásokat, az értékelést, a kutatási munkafolyamatokat, az iterációt és a gyakorlati projekteket.

Kapcsolódó szójegyzékbejegyzések