
Pesquisadores do Instituto de Física de São Carlos (IFSC) da USP desenvolveram um novo método de visão computacional para fazer o reconhecimento de texturas em imagens. O sistema, denominado Vortex, tem a capacidade de analisar várias partes da imagem simultaneamente, estabelecendo conexões para distinguir variações de textura.
Entre as potenciais aplicações da técnica estão a análise de tecidos biológicos, a identificação de materiais e o mapeamento das características da superfície da Terra. A pesquisa, que teve a colaboração de pesquisadores da Universidade Estadual de São Paulo (Unesp) e do KTH Royal Institute of Technology, na Suécia, é descrita em artigo publicado na revista Neurocomputing.
“O objetivo do estudo foi desenvolver métodos de visão computacional específicos para análise de textura ou padrões complexos”, declara ao Jornal da USP o professor Odemir Martinez Bruno, do IFSC, coordenador da pesquisa. “Estes padrões são muito comuns em imagens médicas, de microscopia, produzidas por satélite, entre outras.”
Atualmente, o sistema mais avançado usado na análise de texturas são as chamadas redes neurais convolucionais, sistemas de inteligência artificial especialmente desenvolvidos para trabalhar com imagens. A base da técnica desenvolvida pelos pesquisadores é o Vision Transformers (ViT), que usa uma arquitetura de redes tipo “transformers”, já adotada em ferramentas de análise de texto, como o GPT, Gemini e Cloud, mas adaptada especificamente para visão computacional.
Autoatenção
“A característica central dos transformers é a autoatenção: cada elemento da entrada pode ser analisado separadamente em relação aos demais, permitindo ao modelo captar relações entre partes próximas ou distantes. Várias operações de atenção funcionam em paralelo, em camadas sucessivas”, explica o professor. “A semelhança com o GPT está nesse mecanismo. Nele, os elementos (tokens) representam trechos de texto, enquanto no ViT são pequenos recortes de uma imagem, chamados de patches.”
De acordo com Bruno, o Vortex usa um ViT pré-treinado para extrair todas as características da imagem, ajustadas em mínimos quadrados para formar o descritor de textura. “Em seguida, uma SVM linear é treinada com os descritores e os rótulos das imagens”, relata. O SVM, sigla em inglês para Support Vector Machine, Máquina de Vetores de Suporte, é um algoritmo de aprendizado de máquina usado para tarefas de classificação.
Em um teste com o banco de imagens conhecido como DTD, o Vortex alcançou 87,6% de precisão, o melhor resultado relatado pelos autores para aquele conjunto de dados. A técnica também estabeleceu novos resultados de referência nos conjuntos FMD e GTOS-Mobile. Uma versão do Vortex processou as características de uma imagem de 224 por 224 pixels em cerca de 4,5 milésimos de segundo, usando um computador equipado com uma placa gráfica de alto desempenho.
Segundo o professor, o método pode ajudar a identificar padrões em imagens de microscopia, imagens médicas e imagens de satélite. “Isso abre possibilidades, por exemplo, para analisar tecidos biológicos, distinguir materiais e reconhecer características da superfície terrestre”, conclui.
O estudo teve a participação de Leonardo Scabini e Odemir Martinez Bruno, do IFSC, Kallil M. Zielinski, do Instituto de Ciências Matemáticas e de Computação (ICMC) da USP em São Carlos, Emir Konuk e Kevin Smith, do KTH Royal Institute of Technology, na Suécia, e Ricardo T. Fares e Lucas C. Ribas, da Universidade Estadual Paulista (Unesp), em São José do Rio Preto. As conclusões do trabalho são apresentadas no artigo VORTEX: Challenging CNNs at texture recognition by using vision transformers with orderless and randomized token encodings, publicado na revista científica Neurocomputing.
Matéria: Júlio Bernardes | Jornal da USP.





