Foram encontradas 708 questões.
Em relação às diferenças conceituais e aplicações da Análise de Componentes Principais (PCA) e da Análise Fatorial (AF), julgue os itens a seguir:
I. A PCA busca combinações lineares (componentes principais) que retêm a máxima variância total dos dados observados, sem postular um modelo de erros ou fatores latentes; já a Análise Fatorial assume que as variáveis observadas são funções lineares de fatores latentes comuns acrescidos de erros únicos (especificidades).
II. Na PCA, os componentes são ortogonais e ordenados por variância explicada; na Análise Fatorial, os fatores podem ser rotacionados (ex.: varimax) para facilitar a interpretação, e a comunalidade representa a proporção da variância de cada variável explicada pelos fatores comuns.
III. Uma diferença prática importante é que a PCA é frequentemente usada para redução de dimensionalidade quando o interesse é reter a maior parte da informação, enquanto a Análise Fatorial é mais adequada para identificar estruturas latentes subjacentes (ex.: traços de personalidade, construtos socioeconômicos).
IV. A PCA é invariante a rotações ortogonais dos componentes, ou seja, qualquer rotação dos eixos principais produz a mesma solução; já na Análise Fatorial, a rotação é essencial para tornar os fatores interpretáveis, e diferentes métodos de rotação podem levar a diferentes soluções fatoriais.
V. A PCA pressupõe que os dados seguem uma distribuição normal multivariada e que não há outliers, caso contrário os resultados são sempre inválidos; a Análise Fatorial, por outro lado, é robusta a qualquer tipo de distribuição e não requer normalidade.
Assinale a alternativa com a sequência CORRETA (V/F):
Provas
- Estatística InferencialIntervalos de confiança
- Estatística InferencialEstimadoresPropriedades dos estimadores
- Estatística InferencialEstatística Não Paramétrica
Em relação à técnica de Bootstrap e suas aplicações em inferência estatística, julgue os itens a seguir:
I. A principal vantagem do Bootstrap é permitir estimar a distribuição amostral de uma estatística (ex.: média, mediana, coeficiente de correlação) sem assumir uma distribuição populacional específica, utilizando reamostragem com reposição a partir dos dados observados.
II. O Bootstrap reduz a necessidade de grandes amostras: com amostras muito pequenas (ex.: n = 5), o Bootstrap produz estimativas consistentes e não viesadas, mesmo quando a distribuição original é assimétrica.
III. O Bootstrap paramétrico assume uma forma paramétrica para a distribuição populacional (ex.: Normal) e reamostra a partir da distribuição estimada, enquanto o Bootstrap não paramétrico reamostra diretamente dos dados empíricos.
IV. O Bootstrap é computacionalmente mais eficiente que os métodos analíticos (ex.: fórmulas para erro padrão), pois requer apenas alguns segundos mesmo com milhões de reamostras, enquanto fórmulas analíticas exigem cálculos complexos e lentos.
V. O Bootstrap pode ser usado para construir intervalos de confiança (ex.: percentil, BCa), estimar viés de estimadores e calcular erros padrão, sendo especialmente útil quando a estatística de interesse não tem uma expressão analítica simples para sua variância.
Assinale a alternativa com a sequência CORRETA (V/F):
Provas
Um analista de dados de um órgão público tem acesso a uma base com informações de beneficiários de programas sociais, contendo: CPF, nome completo, renda familiar, endereço, diagnóstico de saúde (opcional) e data de nascimento. Ele deseja publicar um estudo agregado por município, mantendo o sigilo dos indivíduos. Em relação à Lei Geral de Proteção de Dados (LGPD) e às boas práticas éticas em estatística pública, julgue os itens a seguir:
I. O CPF e o nome completo são considerados dados pessoais sensíveis pela LGPD, exigindo consentimento explícito do titular mesmo para uso em políticas públicas.
II. A anonimização, segundo a LGPD, é o processo de tornar os dados não associáveis a uma pessoa identificada ou identificável, usando técnicas como generalização, supressão ou ruído. Dados verdadeiramente anonimizados não são mais considerados dados pessoais.
III. O diagnóstico de saúde (ex.: HIV, câncer) é classificado como dado pessoal sensível pela LGPD (art. 5º, II), e seu tratamento requer fundamento legal específico, como a execução de políticas públicas pela administração pública (art. 7º, III).
IV. Publicar uma tabela com a renda média por município, sem qualquer identificador individual, é suficiente para garantir anonimização, independentemente do número de observações por município, pois dados agregados não violam a LGPD.
V. Em um estudo ético, o analista deve aplicar o princípio da minimização: coletar e armazenar apenas os dados estritamente necessários para a finalidade da análise, descartando identificadores diretos quando não forem mais úteis.
Assinale a alternativa com a sequência CORRETA (V/F):
Provas
Uma universidade deseja comparar três métodos de ensino (A, B, C) quanto ao desempenho dos estudantes. Inicialmente, planeja-se um delineamento inteiramente casualizado (DIC): 90 alunos são sorteados aleatoriamente e igualmente distribuídos entre os três métodos (30 por método). Um professor sugere usar delineamento em blocos casualizados (DBC), considerando o turno de estudo (manhã, tarde, noite) como bloco, pois acredita que o turno influencia o desempenho. Na universidade, há 30 alunos por turno (total 90). Em cada turno, os 30 alunos são aleatoriamente atribuídos aos três métodos (10 por método por turno). Em relação à análise e interpretação desses delineamentos, julgue os itens a seguir:
I. No DIC, a aleatorização é irrestrita: os 90 alunos são sorteados para os métodos sem considerar turno. A ANOVA correspondente particiona a variabilidade total em SQTratamentos (métodos) e SQResíduo. Se houver diferença significativa entre os métodos, o pesquisador pode concluir que o efeito é causal, desde que a alocação tenha sido aleatória.
II. No DBC com blocos de turno, a soma de quadrados total é decomposta em SQBlocos (turno), SQTratamentos (métodos) e SQResíduo. O DBC é mais eficiente que o DIC se a variabilidade entre blocos for grande, pois reduz a SQResíduo e aumenta o poder do teste F para os métodos.
III. Suponha que, no DBC, a interação entre bloco e tratamento não seja modelada (modelo aditivo – sem interação). Se houver interação real (ex.: o método A é melhor no turno da manhã, mas pior no noturno), essa interação irá para o resíduo, inflacionando o erro experimental e podendo mascarar efeitos principais ou gerar conclusões enganosas.
IV. Os graus de liberdade do resíduo no DIC são 90 − 3 = 87. No DBC com 3 blocos e 3 tratamentos e 10 repetições por combinação bloco×tratamento, os graus de liberdade do resíduo são (3 − 1) × (3 − 1) × 10 = 2 × 2 × 10 = 40.
V. Se um pesquisador aplicasse o DIC e, após verificar diferença significativa entre os métodos, incluísse o turno como covariável na análise de covariância (ANCOVA), isso equivaleria a um DBC com ajuste linear, desde que o efeito do turno fosse modelado como contínuo (ex.: hora de início). Contudo, se o turno for categórico (manhã, tarde, noite), a abordagem correta é o DBC ou a inclusão de dummies no modelo.
Assinale a alternativa com a sequência CORRETA (V/F):
Provas
Uma amostra aleatória de tamanho n = 100 de uma
população normalmente distribuída com média μ
\(\bar{x} = 81,2, \sum_{i=1}^{100} (x_i - \bar{x})^2 = 2475.\)
Deseja-se testar:
H0:
ao nível de significância de 5%. A variância populacional é desconhecida.
Assinale a alternativa que apresenta corretamente o critério de decisão baseado na estatística t (ou equivalentemente na média amostral xˉ) e a decisão correspondente:
Provas
Uma variável aleatória X segue uma distribuição Qui-quadrado (X2 ) com 10 graus de liberdade. Em relação às propriedades da distribuição Qui-quadrado e suas aplicações, julgue os itens a seguir:
I. A média de X é igual aos graus de liberdade (E[X] = 10), e a variância é igual a duas vezes os graus de liberdade (Var(X) = 20).
II. A distribuição Qui-quadrado é simétrica em torno de sua média para qualquer número de graus de liberdade.
III. A variável X pode ser representada como a soma de
10 variáveis aleatórias independentes, cada uma com
distribuição Normal padrão ao quadrado: X = \( \sum_{i=1}^{10} Z_i^2 \)
IV. A moda da distribuição X2
com v graus de liberdade
ocorre em v
V. A distribuição Qui-quadrado é um caso particular da
distribuição Gama, com parâmetros de forma k = v/2
Assinale a alternativa com a sequência CORRETA (V/F):
Provas
- Análise MultivariadaAnálise Fatorial
- Análise MultivariadaAnálise Discriminante
- Análise MultivariadaAnálise de Agrupamentos (Clustering)
Um pesquisador dispõe de uma matriz de dados com 100 observações e 50 variáveis socioeconômicas. Ele aplica as seguintes técnicas: análise fatorial por máxima verossimilhança (AF), análise discriminante linear (LDA) e clusterização hierárquica. Em relação às propriedades e diferenças entre esses métodos, julgue os itens a seguir:
I. Na análise fatorial (método de máxima verossimilhança), assume-se que as variáveis observadas são combinações lineares de poucos fatores latentes comuns mais termos de erro únicos (especificidades), não correlacionados entre si. A solução dos loadings não é única, podendo ser rotacionada (ex.: varimax) sem alterar a comunalidade total.
II. A análise discriminante linear (LDA) para classificação assume que as covariâncias dentro dos grupos são homogêneas e que os dados seguem distribuição normal multivariada. Quando essas suposições são violadas, a LDA ainda é robusta e geralmente supera a regressão logística em termos de acurácia.
III. A clusterização hierárquica aglomerativa com ligação simples (single linkage) define a distância entre dois clusters como a distância mínima entre qualquer ponto de um cluster e qualquer ponto do outro. Esse método tende a produzir clusters alongados e é sensível a outliers, podendo gerar o efeito de "cadeia".
IV. Diferentemente da LDA, a análise fatorial não utiliza informação sobre grupos predefinidos; ela é uma técnica não supervisionada. No entanto, os escores fatoriais obtidos podem ser usados posteriormente como variáveis de entrada em uma LDA para classificação.
V. A clusterização hierárquica com ligação completa (complete linkage) é monotônica (não produz inversões no dendrograma) e tende a formar clusters compactos. Se os dados contiverem outliers, a ligação completa é mais afetada do que a ligação simples porque um outlier isolado forma um cluster de tamanho 1 a uma distância muito grande dos demais. Assinale a alternativa com a sequência CORRETA (V/F):
Provas
Uma universidade pública deseja criar um modelo para classificar candidatos ao curso de Estatística em três categorias: "baixo risco de evasão", "médio risco" e "alto risco", com base em variáveis preditoras contínuas (nota no ENEM, coeficiente de rendimento no ensino médio, horas de estudo semanais, renda familiar per capita). O estatístico da instituição opta pela Análise Discriminante Linear (ADL) como técnica de classificação supervisionada.
Assinale a alternativa que apresenta corretamente uma premissa fundamental da ADL e um procedimento de validação apropriado.
Provas
- Fundamentos
- Estatística DescritivaMedidas de Dispersão
- Estatística DescritivaMedidas de Tendência Central
Em uma pesquisa de clima organizacional aplicada a 2.000 servidores públicos federais, foram coletadas respostas a 20 perguntas (escala Likert de 1 a 5). O estatístico responsável deseja identificar construtos latentes subjacentes (ex.: satisfação com liderança, engajamento, condições de trabalho) que expliquem as correlações observadas entre as variáveis manifestas. Para isso, ele opta pela Análise Fatorial por Eixos Principais com rotação oblíqua (promax), após verificar que o teste de esfericidade de Bartlett foi significativo (p < 0,001) e a medida KMO = 0,87. Avalie as afirmativas a seguir como verdadeiras (V) ou falsas (F):
( ) A Análise Fatorial exige que as variáveis originais sejam independentes entre si, condição verificada pelo teste de Bartlett significativo.
( ) A rotação varimax (ortogonal) seria mais adequada do que a promax, pois a rotação oblíqua sempre produz fatores correlacionados, o que invalida o modelo.
( ) O teste KMO mede a adequação da amostra para a análise fatorial; valores acima de 0,8 indicam boa adequação, como no caso apresentado.
( ) Na Análise Fatorial, as comunalidades representam a parcela da variância total de cada variável que não é explicada pelos fatores comuns.
( ) A rotação dos fatores altera a solução matemática dos autovalores e a variância total explicada, sendo desaconselhada quando o objetivo é puramente redução de dimensionalidade.
As afirmativas são respectivamente:
Provas
Um órgão de controle da administração pública federal dispõe de um banco de dados com 12 indicadores socioeconômicos (PIB per capita, IDH, desigualdade de renda, taxa de analfabetismo, mortalidade infantil, etc.) coletados para 550 municípios. O objetivo é reduzir a dimensionalidade dos dados para construir um índice sintético de desenvolvimento municipal que preserve o máximo possível da variância original, sem utilizar uma variável resposta predefinida. O estatístico do órgão decide aplicar a Análise de Componentes Principais (PCA) com base na matriz de correlações (variáveis padronizadas). Após a análise, os autovalores obtidos foram: λ₁ = 4,2; λ₂ = 2,1; λ₃ = 1,8; λ₄ = 1,2; λ₅ = 0,9; os demais somam 1,8.
Com base nesses resultados e nos fundamentos da PCA, assinale a alternativa CORRETA:
Provas
Caderno Container