Prompt Engineering for Vision Models
Una introducción práctica al prompting y control de modelos de visión para segmentación de imágenes, detección de objetos, generación de imágenes, in-painting y generación personalizada de imágenes.
Acerca del curso
Prompt Engineering for Vision Models es un curso corto para principiantes de DeepLearning.AI en colaboración con Comet. Extiende la ingeniería de prompts más allá de los modelos basados en texto y demuestra cómo los modelos de visión pueden controlarse mediante lenguaje natural, coordenadas de píxeles, cuadros delimitadores, máscaras de segmentación y parámetros de generación. Los estudiantes trabajan con tecnologías como Segment Anything Model de Meta, OWL-ViT, Stable Diffusion y DreamBooth, mientras exploran la segmentación de imágenes, detección de objetos, generación de imágenes, in-painting, ajuste fino y seguimiento de experimentos.
Abre un sitio web externo en una nueva pestaña.
Resultados de aprendizaje
- Comprender cómo difiere el prompting entre modelos de texto y de visión
- Realizar prompts en modelos de visión usando texto, coordenadas y cuadros delimitadores
- Ajustar parámetros de generación de imágenes como la escala de guía, la fuerza y los pasos de inferencia
- Usar modelos de segmentación de imágenes para aislar partes de una imagen
- Usar prompts de lenguaje natural para la detección de objetos zero-shot
- Combinar segmentación, detección de objetos y generación de imágenes para in-painting
- Comprender cómo DreamBooth puede personalizar las salidas de los modelos de difusión
- Usar el seguimiento de experimentos para comparar el prompting visual y las configuraciones de hiperparámetros
Habilidades incluidas
Ingeniería de prompts, Visión artificial, Prompting multimodal, Generación de imágenes, Segmentación de imágenes, Detección de objetos, Modelos de difusión, Ajuste fino, In-painting, Personalización de IA, Seguimiento de experimentos
Plan de estudios
- Introducción
Presenta la ingeniería de prompts visuales y los objetivos del curso.
- Visión general
Explica los modelos de visión, los métodos de prompting y los flujos de trabajo utilizados a lo largo del curso.
- Segmentación de imágenes
Explora el prompting de modelos de segmentación de imágenes con coordenadas positivas y negativas y cuadros delimitadores.
- Detección de objetos
Utiliza prompts de lenguaje natural con modelos de detección de objetos para localizar y aislar objetos dentro de las imágenes.
- Generación de imágenes
Explora la generación de imágenes basada en difusión y parámetros como la escala de guía, la fuerza y los pasos de inferencia.
- Ajuste fino
Introduce la personalización de modelos de difusión usando DreamBooth y demuestra cómo el ajuste fino puede proporcionar un mayor control sobre las imágenes generadas.
- Conclusión
Revisa las principales técnicas de ingeniería de prompts visuales y los flujos de trabajo cubiertos en el curso.
Requisitos previos
- Se recomienda experiencia en Python
- No se requiere experiencia avanzada en visión artificial
Público objetivo
Diseñadores de IA, Desarrolladores, Ingenieros de prompts, Tecnólogos creativos, Creadores de contenido de IA, Principiantes en visión artificial, Profesionales de la IA generativa
Ideal para
- Estudiantes que siguen una ruta de aprendizaje de diseñador de IA
- Ingenieros de prompts que se expanden hacia la IA multimodal
- Desarrolladores interesados en aplicaciones de imágenes generativas
- Creadores que quieren entender los fundamentos técnicos de la generación de imágenes por IA
- Usuarios de Python que comienzan a explorar la visión artificial y los modelos de difusión
Ventajas
- Introducción práctica a la ingeniería de prompts visuales
- Cubre múltiples tipos de modelos de visión en lugar de solo la generación de imágenes
- Incluye ejemplos prácticos de código
- Cubre segmentación, detección de objetos, generación de imágenes y ajuste fino
- Introduce la personalización con DreamBooth
- Demuestra el seguimiento de experimentos para el prompting visual iterativo
Desventajas
- Se recomienda experiencia en Python
- Algunos modelos y técnicas cubiertos son implementaciones específicas en lugar de un estudio completo de los sistemas de visión modernos
- El formato corto limita la profundidad de la teoría avanzada de visión artificial
- No proporciona formación integral sobre despliegue en producción
Datos del curso
- Proveedor:
- DeepLearning.AI
- Instructor:
- Abby Morgan, Jacques Verré and Caleb Kaiser
- Duración:
- 1 hour 22 minutes
- Nivel:
- Principiante
- Idioma:
- English
Certificación y modalidad
Certificado disponible
Formato: Online, Self-paced, Video lessons, Interactive code examples
Herramientas que puedes usar con este curso
Stable Diffusion
Un modelo de difusión latente de última generación capaz de generar imágenes fotorrealistas a partir de prompts de texto.
- Este curso hace referencia directa a la herramienta
- La categoría de la herramienta coincide con este curso
DALL-E
Un modelo de IA sofisticado que genera imágenes originales de alta calidad a partir de descripciones de texto.
- La categoría de la herramienta coincide con este curso
Ideogram
Ideogram es un generador de imágenes con IA de vanguardia que se especializa en generar imágenes de alta calidad con texto preciso e integrado.
- La categoría de la herramienta coincide con este curso
Leonardo.ai
Una plataforma de IA generativa versátil para crear activos visuales de alta calidad, optimizada específicamente para el desarrollo de juegos y proyectos creativos.
- La categoría de la herramienta coincide con este curso
Rutas de aprendizaje relacionadas
Ruta de aprendizaje de Ingeniero de Prompts
Una ruta de aprendizaje práctica para desarrollar habilidades de ingeniería de prompts en asistentes y flujos de trabajo de IA modernos. La ruta cubre la estructura de los prompts, el diseño de contexto, la comparación de modelos, las restricciones de salida, la evaluación, los flujos de trabajo de investigación, la iteración y proyectos prácticos.
Ruta de aprendizaje para creadores de contenido con IA
Una ruta de aprendizaje práctica para creadores que desean utilizar la inteligencia artificial en todo el proceso de producción de contenido. La ruta cubre investigación, ideación, redacción, creación visual, producción de video, audio, reutilización, edición, control de calidad y flujos de trabajo de publicación multiformato.
Ruta de aprendizaje para desarrolladores de IA
Una ruta de aprendizaje estructurada para aspirantes a desarrolladores de IA que desean comprender los sistemas de IA modernos y construir aplicaciones útiles impulsadas por IA. La ruta combina conceptos fundamentales, herramientas de IA prácticas, flujos de trabajo de codificación, proyectos guiados e hitos de desarrollo.
Ruta de aprendizaje para diseñadores de IA
Una ruta de aprendizaje práctica para diseñadores, creadores y profesionales visuales que desean integrar la inteligencia artificial en los flujos de trabajo de diseño modernos. La ruta cubre briefs creativos, ideación visual, creación de prompts para imágenes, herramientas de imágenes generativas, diseño de maquetación y presentaciones, mejora de imágenes, consistencia, control de calidad y desarrollo de portafolio.
Términos relacionados
Fine-Tuning
El Fine-Tuning (ajuste fino) es el proceso de entrenar aún más un modelo de IA existente con datos adicionales específicos de una tarea o dominio para modificar su comportamiento o capacidades.
IA multimodal
La IA multimodal se refiere a sistemas que pueden procesar, comprender o generar más de un tipo de información, como texto, imágenes, audio, video o datos estructurados.