Prompt Engineering for Vision Models
Gyakorlati bevezetés a látásalapú modellek promptolásába és vezérlésébe képszegmentáláshoz, objektumfelismeréshez, képgeneráláshoz, in-paintinghez és személyre szabott képgeneráláshoz.
A kurzusról
A Prompt Engineering for Vision Models egy kezdő szintű rövid kurzus a DeepLearning.AI-tól, a Comet közreműködésével. Kiterjeszti a prompt engineeringet a szövegalapú modelleken túlra, és bemutatja, hogyan vezérelhetők a látásalapú modellek természetes nyelv, pixelkoordináták, határolókeretek, szegmentációs maszkok és generálási paraméterek segítségével. A tanulók olyan technológiákkal dolgoznak, mint a Meta Segment Anything modellje, az OWL-ViT, a Stable Diffusion és a DreamBooth, miközben felfedezik a képszegmentálást, objektumfelismerést, képgenerálást, in-paintinget, finomhangolást és a kísérletkövetést.
Külső webhelyet nyit meg egy új lapon.
Tanulási eredmények
- Megérteni, hogyan különbözik a promptolás a szöveges és látásalapú modellek között
- Látásalapú modellek promptolása szöveggel, koordinátákkal és határolókeretekkel
- Képgenerálási paraméterek, például guidance scale, erősség és következtetési lépések beállítása
- Képszegmentációs modellek használata egy kép részeinek izolálására
- Természetes nyelvű promptok használata zero-shot objektumfelismeréshez
- Szegmentálás, objektumfelismerés és képgenerálás kombinálása in-paintinghez
- Megérteni, hogyan szabhatja személyre a DreamBooth a diffúziós modellek kimeneteit
- Kísérletkövetés használata a vizuális promptolás és hiperparaméter-konfigurációk összehasonlítására
Elsajátítható készségek
Prompt Engineering, Számítógépes látás, Multimodális promptolás, Képgenerálás, Képszegmentálás, Objektumfelismerés, Diffúziós modellek, Finomhangolás, In-painting, AI-személyre szabás, Kísérletkövetés
Tananyag
- Bevezetés
Bemutatja a vizuális prompt engineeringet és a kurzus céljait.
- Áttekintés
Elmagyarázza a kurzus során használt látásalapú modelleket, promptolási módszereket és munkafolyamatokat.
- Képszegmentálás
Felfedezi a képszegmentációs modellek promptolását pozitív és negatív koordinátákkal, valamint határolókeretekkel.
- Objektumfelismerés
Természetes nyelvű promptokat használ objektumfelismerő modellekkel objektumok lokalizálására és izolálására képeken belül.
- Képgenerálás
Felfedezi a diffúzióalapú képgenerálást és az olyan paramétereket, mint a guidance scale, az erősség és a következtetési lépések.
- Finomhangolás
Bemutatja a diffúziós modellek személyre szabását a DreamBooth segítségével, és bemutatja, hogyan biztosíthat a finomhangolás nagyobb kontrollt a generált képek felett.
- Következtetés
Áttekinti a kurzus során lefedett főbb vizuális prompt engineering technikákat és munkafolyamatokat.
Előfeltételek
- Python-ismeret ajánlott
- Nincs szükség haladó számítógépes látás szakértelemre
Célközönség
AI-tervezők, Fejlesztők, Prompt mérnökök, Kreatív technológusok, AI-tartalomkészítők, Számítógépes látás kezdők, Generatív AI-gyakorlók
Ideális ehhez
- AI Designer tanulási utat követő tanulók
- Multimodális AI felé terjeszkedő prompt mérnökök
- Generatív képi alkalmazások iránt érdeklődő fejlesztők
- Alkotók, akik meg akarják érteni az AI képgenerálás technikai alapjait
- Python-felhasználók, akik most kezdik felfedezni a számítógépes látást és a diffúziós modelleket
Előnyök
- Gyakorlati bevezetés a vizuális prompt engineeringbe
- Többféle látásalapú modellt fed le, nem csak a képgenerálást
- Gyakorlati kódpéldákat tartalmaz
- Lefedi a szegmentálást, objektumfelismerést, képgenerálást és finomhangolást
- Bemutatja a DreamBooth személyre szabást
- Bemutatja a kísérletkövetést az iteratív vizuális promptoláshoz
Hátrányok
- Python-tapasztalat ajánlott
- Néhány lefedett modell és technika specifikus implementáció, nem pedig a modern látásrendszerek teljes körű áttekintése
- A rövid formátum korlátozza a haladó számítógépes látáselmélet mélységét
- Nem nyújt átfogó éles környezetbe történő telepítési képzést
Kurzusadatok
- Szolgáltató:
- DeepLearning.AI
- Oktató:
- Abby Morgan, Jacques Verré and Caleb Kaiser
- Időtartam:
- 1 hour 22 minutes
- Szint:
- Kezdő
- Nyelv:
- English
Tanúsítvány és képzési forma
Tanúsítvány elérhető
Formátum: Online, Self-paced, Video lessons, Interactive code examples
Eszközök a kurzushoz
Stable Diffusion
Egy korszerű látens diffúziós modell, amely képes fotorealisztikus képeket generálni szöveges utasításokból.
- Ez a kurzus közvetlenül hivatkozik az eszközre
- Az eszköz kategóriája megegyezik a kurzuséval
DALL-E
Egy kifinomult AI-modell, amely eredeti, kiváló minőségű képeket generál szöveges leírásokból.
- Az eszköz kategóriája megegyezik a kurzuséval
Ideogram
Az Ideogram egy élvonalbeli AI képgenerátor, amely kiváló minőségű, pontos, beépített szöveggel ellátott képek generálására specializálódott.
- Az eszköz kategóriája megegyezik a kurzuséval
Leonardo.ai
Egy sokoldalú generatív AI platform kiváló minőségű vizuális eszközök létrehozásához, kifejezetten játékfejlesztésre és kreatív projektekre optimalizálva.
- Az eszköz kategóriája megegyezik a kurzuséval
Kapcsolódó tanulási útvonalak
AI tartalomkészítő tanulási útvonal
Gyakorlati tanulási útvonal azoknak az alkotóknak, akik a mesterséges intelligenciát szeretnék használni a tartalomgyártás teljes folyamatában. Az útvonal lefedi a kutatást, az ötletelést, az írást, a vizuális alkotást, a videógyártást, a hanganyagokat, az újrahasznosítást, a szerkesztést, a minőségellenőrzést és a többformátumú közzétételi munkafolyamatokat.
AI-fejlesztői tanulási útvonal
Strukturált tanulási útvonal azon törekvő AI-fejlesztők számára, akik meg akarják érteni a modern AI-rendszereket és hasznos, AI-alapú alkalmazásokat szeretnének építeni. Az útvonal ötvözi az alapvető fogalmakat, a gyakorlati AI-eszközöket, a kódolási munkafolyamatokat, az irányított projekteket és a fejlesztési mérföldköveket.
AI-tervező tanulási útvonal
Gyakorlati tanulási útvonal tervezők, alkotók és vizuális szakemberek számára, akik integrálni szeretnék a mesterséges intelligenciát a modern tervezési munkafolyamatokba. Az útvonal lefedi a kreatív briefeket, a vizuális ötletelést, a képpromptolást, a generatív képi eszközöket, az elrendezés- és prezentációtervezést, a képjavítást, a konzisztenciát, a minőségellenőrzést és a portfóliófejlesztést.
Promptmérnök tanulási útvonal
Gyakorlati tanulási útvonal a promptmérnöki készségek fejlesztéséhez a modern AI-asszisztensek és munkafolyamatok területén. Az útvonal lefedi a prompt szerkezetét, a kontextus tervezését, a modell-összehasonlítást, a kimeneti korlátozásokat, az értékelést, a kutatási munkafolyamatokat, az iterációt és a gyakorlati projekteket.
Kapcsolódó szójegyzékbejegyzések
Finomhangolás (Fine-Tuning)
A finomhangolás egy meglévő MI-modell további képzésének folyamata kiegészítő, feladatspecifikus vagy tartományspecifikus adatokon, a viselkedésének vagy képességeinek módosítása érdekében.
Multimodális MI
A multimodális MI olyan rendszerekre utal, amelyek egynél több típusú információt képesek feldolgozni, megérteni vagy generálni, például szöveget, képeket, hangot, videót vagy strukturált adatokat.