Segundo pesquisa da ATD (Association for Talent Development) de 2025, 71% das organizações usam o modelo Kirkpatrick como framework de avaliação de aprendizagem, o que o torna disparadamente o mais adotado do mercado. Mas um levantamento anterior da mesma instituição mostrou que apenas 35% das empresas de fato avaliam o impacto dos treinamentos nos resultados do negócio.
Essa distância entre adoção e uso completo é o ponto central deste artigo. Muitas equipes de T&D conhecem o modelo Kirkpatrick, aplicam pesquisas de satisfação ao final dos cursos e param por aí, deixando de lado justamente os dados que provariam o valor do treinamento para a liderança.
Neste conteúdo, você vai entender os quatro níveis do modelo, como ele foi atualizado na versão chamada de Novo Mundo, como aplicá-lo na prática planejando de trás para frente e quais erros mais comprometem essa avaliação no dia a dia do T&D.
O que é o modelo Kirkpatrick e para que ele serve?
O modelo Kirkpatrick é um framework de avaliação de treinamento que mede o impacto de um programa em quatro níveis progressivos: Reação, Aprendizagem, Comportamento e Resultados. Cada nível responde a uma pergunta diferente sobre se o treinamento está funcionando, e cada um se torna mais difícil, e mais valioso, de medir do que o anterior.
Criado por Donald Kirkpatrick em sua tese de doutorado na Universidade de Wisconsin em 1954 e publicado em uma série de artigos em 1959, o modelo se tornou o padrão de fato do setor após o lançamento do livro “Evaluating Training Programs: The Four Levels”, em 1994. Hoje reúne mais de 14 mil profissionais certificados pela Kirkpatrick Partners em todo o mundo.
Embora seja mais aplicado a treinamentos corporativos e programas de e-learning, o modelo é flexível o suficiente para avaliar praticamente qualquer tipo de intervenção de aprendizagem.
Quais são os 4 níveis do modelo Kirkpatrick?
Os quatro níveis avançam da percepção imediata dos participantes até o impacto mensurável no negócio. A tabela resume o que cada nível responde e como costuma ser medido.
| Nível | Pergunta que responde | Métodos comuns | Quando medir |
| 1. Reação | Os participantes acharam o treinamento relevante e engajador? | Pesquisas pós-treinamento, pulse checks | Durante e logo após |
| 2. Aprendizagem | Os participantes adquiriram o conhecimento e as habilidades propostos? | Testes, simulações, demonstrações práticas | Durante e ao final |
| 3. Comportamento | Os participantes estão aplicando o que aprenderam no trabalho? | Observação, avaliação de desempenho, feedback 360° | A partir de poucas semanas depois |
| 4. Resultados | O treinamento gera impacto mensurável no negócio? | KPIs de negócio, indicadores antecedentes e consequentes | De 3 a 12 meses depois |
Nível 1: Reação
O primeiro nível mede como os participantes reagem ao treinamento: se o acharam engajador, relevante e útil. É o dado mais comumente coletado, geralmente por meio de uma pesquisa curta ao final da ação, o chamado “smile sheet”.
Uma atualização importante da versão mais recente do modelo é que a relevância percebida prevê a mudança de comportamento muito melhor do que a satisfação isolada. Um participante pode gostar de um treinamento e, ainda assim, não aplicar nada do que viu. Por isso, vale construir a pesquisa de reação em torno de perguntas sobre relevância para o trabalho, não apenas sobre satisfação geral.
Nível 2: Aprendizagem
O segundo nível mede se os participantes realmente adquiriram o conhecimento, as habilidades e as atitudes que o treinamento se propôs a ensinar. É a base da maior parte do trabalho de design instrucional, com testes, demonstrações e avaliações finais.
A versão atualizada do modelo expande esse nível além do conhecimento técnico, incluindo dois novos indicadores: confiança (o participante acredita que consegue aplicar aquilo no trabalho?) e comprometimento (ele pretende de fato aplicar?). Os dois costumam prever melhor a mudança de comportamento no nível seguinte do que o conhecimento isolado.
Nível 3: Comportamento
O terceiro nível mede se as pessoas estão aplicando o que aprenderam no dia a dia de trabalho. Aprender algo em sala de aula e aplicar de volta na rotina são coisas diferentes, e é neste nível que o modelo começa a gerar dados realmente acionáveis.
A medição do comportamento deve começar cedo, dentro de duas a quatro semanas após o treinamento, e não depois de 90 dias como recomendavam versões mais antigas do modelo: esperar demais reduz a chance de ajustar o programa a tempo. Donald Kirkpatrick já identificava quatro condições necessárias para a mudança de comportamento: desejo de mudar, conhecimento do que fazer, um ambiente favorável, com apoio da liderança e obstáculos removidos, e recompensas por fazer a mudança.
Nível 4: Resultados
O último nível mede se o treinamento está movendo indicadores que importam para o negócio: vendas, satisfação do cliente, retenção, taxa de erro, produtividade. É o nível que prova o valor do T&D, e também o mais frequentemente ignorado pelas empresas.
Em vez de perseguir um número exato de ROI financeiro, algo extremamente difícil de isolar com precisão, a versão atual do modelo propõe três medidas complementares que juntas formam um “retorno integrado”: Retorno sobre Expectativas (o treinamento entregou o que os stakeholders definiram como sucesso?), Retorno sobre Performance (as pessoas aplicaram os comportamentos críticos, e isso contribuiu para os resultados?) e ROI Contributivo (reconhece que o treinamento contribui para o resultado ao lado de outros fatores, sem reivindicar todo o crédito).
Por que a maioria das empresas para no nível 2?
Os dados da ATD citados no início deste artigo mostram um padrão recorrente: as equipes de T&D adotam o modelo Kirkpatrick, mas raramente avançam além da reação e do aprendizado. Os níveis 3 e 4 exigem mais tempo, mais dados de negócio e mais colaboração com gestores de outras áreas, o que os torna mais difíceis de sustentar.
Boa parte desse problema começa antes mesmo do treinamento acontecer: sem um bom diagnóstico de necessidades de treinamento, fica ainda mais difícil saber quais indicadores de negócio o nível 4 deveria acompanhar.
O problema é que justamente os dados mais valiosos, aqueles que provam se o treinamento mudou comportamento e gerou resultado, ficam de fora da equação. Sem eles, a área de T&D segue dependendo de “achismo” para justificar orçamento, o que enfraquece sua posição estratégica dentro da empresa.
Parar no nível 1 é o erro mais comum na aplicação do modelo: a equipe foca demais na satisfação e nunca avança para medir aprendizado, comportamento e resultado, o que limita drasticamente a visão sobre o impacto real do investimento em T&D.
Como aplicar o modelo Kirkpatrick na prática?
A forma mais eficaz de usar o modelo é planejar de trás para frente: começar pelo nível 4, com o resultado de negócio esperado, e só depois descer até os comportamentos e o aprendizado que produzem esse resultado.
- Defina os resultados do nível 4 com os stakeholders. Qual resultado mensurável de negócio esse treinamento deve sustentar, seja redução de turnover, aumento de produtividade ou outro indicador? Documente a meta como o Retorno sobre Expectativas combinado com o patrocinador da iniciativa.
- Identifique os comportamentos críticos do nível 3. Junto de especialistas e gestores da linha de frente, liste os comportamentos específicos no trabalho que impulsionam o resultado esperado. É melhor focar em poucos comportamentos que realmente importam.
- Planeje os drivers necessários. Para cada comportamento crítico, defina o que precisa existir no ambiente de trabalho para sustentá-lo: quem reforça, o que é medido e o que é recompensado.
- Defina os objetivos de aprendizagem do nível 2. Que conhecimento, habilidades, confiança e comprometimento os participantes precisam desenvolver para executar os comportamentos críticos?
- Desenhe a experiência do nível 1. Construa o treinamento priorizando relevância antes de engajamento, deixando clara a ligação entre a sessão e o que será aplicado no trabalho.
- Construa os instrumentos de avaliação antes do lançamento. Pesquisas, testes, checklists e painéis devem estar prontos antes do treinamento começar, para não perder o dado de linha de base.
- Meça, reporte e ajuste continuamente. Compartilhe os resultados com os patrocinadores. Onde o programa funciona, escale; onde não funciona, investigue o desenho, a entrega ou a falta dos drivers necessários.
O que mudou no modelo Kirkpatrick do Novo Mundo?
O chamado modelo Kirkpatrick do Novo Mundo, desenvolvido por Jim Kirkpatrick e Wendy Kayser Kirkpatrick na década de 2010, mantém os quatro níveis originais, mas corrige a principal fragilidade da versão dos anos 1950: a suposição de que um bom treinamento leva automaticamente à mudança de comportamento e ao resultado de negócio.
As principais adições incluem o planejamento de trás para frente a partir do nível 4, os drivers necessários no nível 3, confiança e comprometimento como indicadores do nível 2, e as três medidas de retorno integrado no nível 4, no lugar da busca isolada por um percentual exato de ROI.
O modelo passou por uma atualização adicional em 2026: Vanessa Milara Alzate expandiu o framework para incluir explicitamente o ambiente de performance, ou seja, os sistemas, a cultura e os fatores externos que determinam se o aprendizado se transforma em comportamento e depois em resultado. Essa expansão também estendeu a aplicação do modelo para além do T&D, em direção à performance de toda a empresa.
Na prática, quem está estudando o modelo hoje deve aprender a versão do Novo Mundo: a estrutura original de 1959 continua sendo a base conceitual, mas a versão atualizada reflete o que a prática de décadas de aplicação em organizações reais revelou sobre suas limitações.
Quais são as alternativas ao modelo Kirkpatrick?
Nenhum modelo de avaliação é perfeito, e algumas metodologias surgiram justamente para endereçar pontos que o Kirkpatrick não cobre com profundidade suficiente.
| Modelo | O que ele adiciona | Melhor para |
| Phillips ROI Methodology | Um quinto nível (ROI financeiro) com metodologia específica para isolar o impacto do treinamento e convertê-lo em valor monetário | Empresas que precisam de um número de ROI defensável |
| LTEM (Thalheimer) | Modelo de oito níveis criado para corrigir os elos causais frágeis do Kirkpatrick, distinguindo presença e atividade de competência de decisão e transferência real | Times que querem avaliação mais rigorosa cientificamente |
| Modelo CIRO | Quatro etapas (Contexto, Input, Reação, Output), incluindo a análise de necessidades que o Kirkpatrick pressupõe já ter sido feita | Programas que precisam de análise formal de necessidades embutida |
Na prática, muitas empresas usam o Kirkpatrick como espinha dorsal e recorrem a esses outros modelos, ou à combinação deles, quando a situação exige mais rigor em um ponto específico.
Quais erros evitar ao aplicar o modelo Kirkpatrick?
Conhecer os erros mais comuns ajuda a evitar que a avaliação vire só uma formalidade preenchida no fim do curso, sem virar indicadores de treinamento que a área de T&D realmente acompanha ao longo do tempo.
- Parar na reação: focar só na satisfação e nunca avançar para aprendizagem, comportamento e resultado.
- Avaliação genérica: usar as mesmas perguntas e métodos para todos os treinamentos, sem adaptar aos objetivos de cada um.
- Medir o comportamento cedo ou uma única vez: avaliar o nível 3 antes de dar tempo para a aplicação prática, ou medir uma vez só, sem acompanhamento.
- Ignorar o ambiente de trabalho: não considerar se cultura, suporte da liderança e recursos facilitam ou dificultam a aplicação do que foi aprendido.
- Planejar a avaliação depois do treinamento: definir os instrumentos de medição só ao final, perdendo a chance de coletar uma linha de base antes de começar.
Ser realista sobre onde investir esforço também é uma boa prática: nem todo treinamento precisa de uma avaliação de nível 4. Reserve as avaliações mais profundas, nos níveis 3 e 4, para os programas mais estratégicos, de maior investimento ou com maior potencial de impacto no negócio.
Como a Mobiliza auxilia os treinamentos da sua empresa
Medir se um treinamento realmente mudou comportamento e gerou resultado é exatamente o tipo de governança que sustenta um T&D com consistência, escala e credibilidade diante da liderança.
- O Mobiliza LMS reúne dashboard de métricas e relatórios detalhados que acompanham a jornada do colaborador desde a conclusão do curso até indicadores de engajamento, dando à equipe de T&D uma base de dados contínua para os níveis 1 e 2 da avaliação, sem depender só de planilhas paralelas;
- O Módulo Liderança apoia diretamente o nível 3, ao dar aos gestores visibilidade sobre o progresso e o desenvolvimento de seus liderados, o que facilita o acompanhamento do comportamento aplicado no dia a dia;
- Nos níveis de serviço Essencial, Consultivo e Estratégico, o OnePage Report periódico com revisão de métricas ajuda a consolidar, ao longo do tempo, os dados que sustentam uma conversa de nível 4 com a liderança.
Para quem aprova orçamento de T&D, ter uma avaliação estruturada nos quatro níveis é o que separa um relatório de satisfação de uma conversa de resultado: menos “os participantes gostaram” e mais evidência de que o treinamento mudou algo que importa para o negócio.
Quer estruturar a avaliação de treinamentos da sua empresa com apoio de tecnologia e dados desde o primeiro nível até o quarto? Agende uma conversa com um especialista Mobiliza.
