Este livro apresenta de maneira prática como utilizar o modelo Vision-and-Language Transformer (ViLT) para reconhecimento de imagens com apoio textual. Explorando o poder das redes neurais multimodais, mostramos como relacionar imagens a descrições em linguagem natural usando Python e bibliotecas modernas como transformers e torch.
Com um exemplo claro e objetivo, o leitor aprenderá como baixar imagens da internet, processá-las juntamente com textos descritivos e avaliar automaticamente a correspondência entre imagem e descrição, aplicando técnicas avançadas de inferência e interpretação de resultados.
| Número de páginas | 108 |
| Edición | 1 (2025) |
| Formato | A5 (148x210) |
| Acabado | Tapa blanda (con solapas) |
| Tipo de papel | Estucado Mate 90g |
| Idioma | Portugués |
¿Tienes alguna queja sobre ese libro? Envía un correo electrónico a [email protected]
Haz el inicio de sesión deja tu comentario sobre el libro.