Principais responsabilidades: 1. Definir a estratégia e os casos de teste dos agentes de IA (testes funcionais e de qualidade de resposta). 2. Avaliar acurácia, relevância, tom, alucinações e aderência aos guardrails dos agentes. 3. Criar datasets de avaliação e métricas de qualidade (ex.: groundedness, precisão e cobertura). 4. Testar fluxos construídos no Copilot Studio e no Power Automate. 5. Conduzir testes de segurança e de conteúdo (red-teaming básico). 6. Documentar defeitos, acompanhar …