Overfitting no futebol: quando seu modelo vê padrão onde não tem
xG, pressão e odds contam histórias diferentes. Evitar overfitting separa modelo que generaliza de curva que só decora o passado.
Por Equipe editorial Odd Boa · Atualizado em 7 de setembro de 2026
A tentação de decorar o passado
É fácil construir um modelo que acerta 70% dos jogos de uma temporada e erra 48% da seguinte. Esse resultado pode parecer uma descoberta, mas também pode significar que o modelo aprendeu ruído, mudanças específicas daquele calendário ou detalhes que não estarão disponíveis quando a decisão for tomada.
Overfitting acontece quando o modelo se ajusta demais aos dados usados no desenvolvimento. Ele memoriza combinações que funcionaram no passado, mas não consegue generalizar para jogos novos. Em futebol, o risco é alto porque as amostras são pequenas, os elencos mudam e o processo que gerou os dados não permanece estável.
Três armadilhas comuns
1. Misturar passado e futuro na validação
Separar linhas aleatoriamente pode colocar partidas de uma mesma temporada, equipe ou contexto nos dois lados da avaliação. O número final fica otimista porque o teste se parece demais com o treino. Para uma série temporal, use uma divisão por data: treine no período anterior e teste no período posterior.
2. Usar mais variáveis do que a amostra comporta
Quarenta variáveis para algumas centenas de jogos permitem encontrar correlações acidentais. Uma feature pode parecer importante apenas porque acompanhou um recorte específico. Comece com poucas variáveis justificadas, registre a hipótese de cada uma e só acrescente complexidade quando ela melhorar o resultado fora da amostra.
3. Ajustar o teste até ele ficar bonito
Se você escolhe parâmetros repetidamente olhando o mesmo conjunto de teste, ele deixa de ser um teste independente. O modelo passa a aprender também a avaliação. Reserve um período final que só seja aberto depois de congelar decisões de features, parâmetros e filtros.
Um protocolo mínimo de validação
Um protocolo simples é mais útil do que uma curva vistosa. Registre:
- a data de corte disponível para cada decisão;
- as variáveis usadas e quando elas estavam disponíveis;
- o período de treino, validação e teste;
- o número de partidas em cada período;
- a métrica escolhida e a comparação com um baseline;
- as alterações feitas depois de cada avaliação.
Use walk-forward quando o modelo pretende acompanhar o mercado ao longo do tempo. Treine em um intervalo, valide no próximo, avance a janela e repita. Esse processo mostra se o desempenho resiste a mudanças de temporada, competição e contexto.
O que comparar além da taxa de acerto
Taxa de acerto não captura o preço pago. Um modelo pode acertar favoritos em odds baixas e ainda produzir retorno esperado negativo. Compare calibração, log loss ou Brier score quando o modelo entrega probabilidades, além de retorno simulado com regras explícitas.
O fechamento de um mercado líquido pode funcionar como uma referência de preço, desde que você registre qual mercado, horário e fonte está usando. Se uma vantagem aparece apenas contra a odd de abertura e desaparece contra o fechamento, isso merece investigação. Não é prova de edge, mas é um sinal para revisar a metodologia.
Como detectar sinais de overfitting
Procure combinações como:
- desempenho muito alto no treino e queda grande no período seguinte;
- resultado forte em uma liga e fraco em todas as outras;
- melhora que desaparece quando uma ou duas partidas são removidas;
- dezenas de ajustes feitos depois de olhar o mesmo teste;
- ganho concentrado em uma faixa de odds ou em uma única temporada;
- variável importante que não tem explicação esportiva ou operacional.
Nenhum sinal isolado encerra a análise. Juntos, eles indicam que a curva pode estar descrevendo o passado em vez de representar um processo repetível.
Checklist antes de confiar no modelo
- Separe treino e teste por data.
- Mantenha um período final intocado.
- Evite usar informação que só ficou disponível depois do horário da decisão.
- Compare com um baseline simples e com o preço de fechamento.
- Relate quantidade de jogos, ligas, odds e períodos.
- Teste a calibração das probabilidades, não apenas acertos.
- Registre as tentativas e não escolha só o melhor resultado.
- Reavalie o modelo quando o contexto do campeonato mudar.
Um modelo que generaliza não precisa parecer perfeito. Ele precisa continuar razoável quando encontra jogos que não viu, sob regras que foram definidas antes do resultado. Se o CLV ou a calibração somem fora da amostra, trate isso como informação sobre o modelo, não como um convite para aumentar a exposição.
Limites e uso responsável
Modelagem não transforma aposta em renda garantida. Não use dinheiro necessário, não persiga perdas e estabeleça limites antes de qualquer decisão. Se a atividade deixar de ser controlada, pare e procure apoio. A melhor decisão para muitas pessoas é não apostar.