Dados de treino: os padrões dependem da qualidade, não da quantidade
Os dados de treino ajustam um modelo para que este aprenda padrões; a armadilha do exame consiste em ignorar a forma como os enviesamentos, as lacunas ou as fontes ilegais comprometem os resultados.
Ouvir esta página (beta)
Os dados de treino são o conjunto de exemplos fornecidos a um modelo para que este possa aprender padrões, tal como mostrar a uma criança fotografias de gatos para lhe ensinar qual é o aspeto de um gato. O contraste fundamental é que uma maior quantidade de dados nem sempre é melhor — se os seus dados forem enviesados (por exemplo, se incluírem apenas gatos brancos), o modelo falhará perante gatos pretos. A qualidade significa que os dados devem ser representativos, exatos e obtidos legalmente; caso contrário, o modelo aprende os padrões errados.
Para o exame, esteja atento a perguntas que deem a entender que um modelo funciona bem por dispor de muitos dados — trata-se de uma armadilha. Em vez disso, verifique se os dados abrangem todos os casos relevantes (cobertura), não contêm erros sistemáticos (enviesamento) e foram recolhidos com autorização (legalidade). Um teste mental rápido: se fosse o modelo, os dados ensinar-lhe-iam a regra correta? Por exemplo, um modelo de recrutamento treinado apenas com CV de homens aprenderá a preferir homens, não por ser sexista, mas porque os dados não incluem exemplos de mulheres.
Para se lembrar disto, imagine uma balança: num dos pratos está a quantidade dos dados e, no outro, a qualidade dos dados. No exame, a balança inclina-se sempre para a qualidade. Uma verificação rápida: pergunte a si próprio «Estes dados têm lacunas ou problemas jurídicos?». Se a resposta for afirmativa, o resultado do modelo não é fiável, independentemente da quantidade de dados disponível.
O que são dados de treino?
Dados utilizados para treinar ou ajustar um modelo, para que este aprenda padrões.