quinta-feira, 18 de setembro de 2025

Exercícios

  Exercícios

Enviar por Favor para o E-mail da Disciplina:

gestao.estat.cert@gmail.com

        Colocar o número do exercício e o nome do autor ou autores (máximo 3) no assunto do e-mail.

 


 

Exercícios Teóricos

Exercício Teórico 1 – Elabore 7 slides sobre os assuntos

abordados nesta primeira aula. Ver postagem de Slides.

Qualquer coisa que tenha te interessado.

Assuntos

- IA

- CD

- Robótica

- Machine learning

- S Toyota de Gestão 4.0 = Sistema Porsche

- Rede Neural

Dead Line: 28/8/2025

 

Exercício Teórico 2 – Elabore de 4 a 8 slides sobre tipos de IA Indutiva (Machine Learning).

Dead Line: 4/9/2025

 

Exercício Teórico 3 - Enumere e explique os parâmetros que são obtidos a partir da matriz de confusão na IAI Supervisionada para Classificação. Apresente um exemplo. De 8 a 12 slides.

DL: 6/10


 

Exercícios Práticos

 

Exercício Prático 1 -  Regressão Linear Simples em Excel ou LOffice Calc. Sem outlier.

Machine Learning Supervisionado para Predição, Introdução: Regressão Linear Simples


 Exemplo: X: Propaganda - Y: Vendas 

 

X

Y

30

4??

21

3??

35

520

42

490

37

470

2

210

8

195

17

270

35

400

25

480

 

Coloque seus últimos 2 dígitos do numero USP no lugar dos sinais de interrogação.

Elabore um relatório com os resultados, numa linguagem não acadêmica, como se estivesse relatando os resultados para a Dona Luiza, que não sabe estatística mas sabe muito de gestão de negócios.

Dead Line: 19/8/2025

 

Exercício Prático 2 -  Regressão Linear Simples em Excel ou LOffice Calc. Com outlier.

Machine Learning Supervisionado para Predição, Introdução: Regressão Linear Simples


 Exemplo: Propaganda - Vendas 

 

X

Y

30

4??

21

3??

35

520

42

490

37

470

2

210

8

195

17

270

35

400

25

480

3 800     (===> Outlier)

Coloque seus últimos 2 dígitos do numero USP no lugar dos sinais de interrogação.

Elabore um relatório com os resultados, numa linguagem não acadêmica, como se estivesse relatando os resultados para a Dona Luiza, que não sabe estatística mas sabe muito de gestão de negócios.

Dead Line: 19/8/2025

 

Exercício Prático 3 -  Regressão Linear Simples em SAS. Com  e sem outlier.

Machine Learning Supervisionado para Predição, Introdução: Regressão Linear Simples


 Exemplo: Propaganda - Vendas 

 

X

Y

30

4??

21

3??

35

520

42

490

37

470

2

210

8

195

17

270

35

400

25

480

3 800     (===> Outlier)

Coloque seus últimos 2 dígitos do numero USP no lugar dos sinais de interrogação.

Elabore um relatório com os resultados, numa linguagem não acadêmica, como se estivesse relatando os resultados para a Dona Luiza, que não sabe estatística mas sabe muito de gestão de negócios.

Programa SAS para Regressão Robusta

 

 

data propag; 

input X Y;

cards;

DADOS DO EXCEL DO BLOG

;

proc print;

run;

/* Y: Vendas e X:Propaganda */

proc robustreg;

   model Y = X;

run;

 

Dead Line: 26/8/2025

Resultados e D.

A analise com proc reg no sas, deu resultado errado, aconteceria mesma coisa no Excel e L.O. Calq. Assim nunca devemos utilizar prog reg ou as analises do Excel o LOCalq.

Com essa análise errada falaríamos para a CEO do Mag. Luiza (Dona Luiza) que a propaganda não está funcionando.

Agora analisando os dados com a procedure Robustreg, concluímos que a propaganda influencia a venda com 99,99% de confiança.

 Programa SAS feito durante a aula:

data regre;

input X Y;

datalines;

30 459

21 359

35 520

42 490

37 470

2 210

8 195

17 270

35 400

25 480

3 800

;

proc print; run;

/* Ciencia de Dados Robusta é a unica forma de tomada

   de d. na ciencia e tecnologia moderna */

proc robustreg;

    model Y = X;

run;


 Exercício Prático 4

Vamos analisar a Satisfação de Clientes (Y), por exemplo do Mazine Luisa, essa satisfação será nossa variável resposta ou efeito.

Temos 5 variáveis preditoras, ou independentes ou causa, X1, X2, X3, X4 e X5.

Queremos saber quais variáveis preditoras impactam a satisfação do cliente e quantificar esse impacto.

Resolva no SAS com e sem outlier.

Troque os sinais de interrogação pelos últimos dois


 dígitos do seu número USP.


 Banco de Dados

Bu_Unit

Sales

Price

Qu_level

Claims

NPS

Satisfac

1

65,98

97,80

96,77

13,58

98,90

97,83

2

15,84

98,90

98,39

12,35

97,80

98,91

3

8,89

100,00

100,00

11,11

100,00

100,00

4

12,46

98,90

95,16

12,35

96,70

96,74

5

80,67

21,98

19,35

100,00

2,20

21,????

6

32,17

23,08

22,58

97,53

3,30

23,91

7

23,45

24,18

24,19

96,30

2,75

25,00

8

89,96

24,18

19,35

95,06

2,20

26,09

9

31,43

64,84

56,45

50,62

65,93

65,22

10

11,23

65,93

51,61

49,38

71,43

66,30

11

77,46

70,33

53,23

46,91

63,74

68,48

12

23,90

68,13

51,61

45,68

61,54

67,39

13

7,40

86,81

80,65

25,93

90,11

86,96

14

0,29

87,91

79,03

24,69

85,71

85,87

15

83,42

87,91

77,42

22,22

90,11

88,04

16

100,00

86,81

75,81

25,93

84,62

84,78

17

15,84

98,90

98,39

12,35

97,80

28,91


  Conventional and Robust Data Science for SML to Prediction or Regression 

SAS Program


Data Customer;

Input Bu_Unit  Sales  Price Qu_level Claims NPS Satisfac;

Cards;

DADOS DO EXCEL OU LIBRE OFFICE CALC

;

proc print; run;

/* Input Bu_Unit  Sales  Price Qu_level Claims NPS Satisfac; */

proc reg;

   model  Satisfac = Sales  Price Qu_level Claims NPS;

Run;

proc robustreg;

model Satisfac = Sales  Price Qu_level Claims NPS / diagnostic;

Run;


       Arquivo de Resultado e Discussão do Exercício 4


Clicar Aqui !!!


 Ex. Pratico 5 

 

Visualização 6d com IA Indutiva  Não Superv. para Redução de Dimensão: PCA com Biplot

 

Rodar PCA com os dados da regressão múltipla


 data pca_reg;

input Sales Price Qu_level Claims NPS Satisfac;

cards;

65.98 97.8 96.77 13.58 98.9 97.83

15.84 98.9 98.39 12.35 97.8 98.??

8.89 100 100 11.11 100 100

12.46 98.9 95.16 12.35 96.7 96.74

80.67 21.98 19.35 100 2.2 21.59

32.17 23.08 22.58 97.53 3.3 23.91

23.45 24.18 24.19 96.3 2.75 25

89.96 24.18 19.35 95.06 2.2 26.09

31.43 64.84 56.45 50.62 65.93 65.22

11.23 65.93 51.61 49.38 71.43 66.3

77.46 70.33 53.23 46.91 63.74 68.48

23.9 68.13 51.61 45.68 61.54 67.39

7.4 86.81 80.65 25.93 90.11 86.96

0.29 87.91 79.03 24.69 85.71 85.87

83.42 87.91 77.42 22.22 90.11 88.04

100 86.81 75.81 25.93 84.62 84.78

15.84 98.9 98.39 12.35 97.8 28.91

;

proc print; run;

proc prinqual plots=(MDPref);

   transform identity(Sales Price Qu_level Claims NPS Satisfac);  

   ods select MDPrefPlot;

run;



Sumario Executivo - Relatório Técnico do Exercício Pratico 5



Ex. Pratico 6 - Alunos procuram exemplo de repressão múltipla, e IAI Não Superv. para Redução de Dimensão. IBGE, IA, Kaggle, outros repositórios.

Resolver e fazer relatório. DL: 23/9


Ex. Pratico 7  IAI Não S para Agrupamentos e Distancias Multivariados.

DL: 25/9/2025

Inteligência artificial indutiva não supervisionada (Machine Learning) para classificação  - Cluster analysis



Tipos de Machine Learning






Fonte de Dados Sebrae
https://www.isdel-sebrae.com/c%C3%B3pia-in%C3%ADcio-1

Cidade: Caxias do Sul








Tabela Excel dos Dados
 


Cidade

Regiao

Cid_reg

Habitantes

IDH

Rend_Cap

Cap_Empr

Teci_Emr

Gov_Descn

Org_Prod

Ins_Compet

Edu_Empr

Piracicaba

SE

Pir_SE

439

0,785

1,14

0,54

0,695

0,796

0,598

0,761

0,004

Sao_Car

SE

SC_SE

252

0,805

1,08

0,686

0,653

0,812

0,564

0,788

0,002

Sao_Jose

SE

SJ_SE

461

0,797

1,17

0,613

0,73

0,648

0,597

0,769

0,011

Mon_Clar

SE

MC_SE

409

0,77

0,65

0,481

0,651

0,696

0,549

0,666

0,124

Rondono

CO

Ron_CO

232

0,755

0,84

0,452

0,509

0,626

0,567

0,651

0

Anápolis

CO

Aná_CO

387

0,737

0,79

0,481

0,645

0,695

0,562

0,708

0

Camp_Gra

NE

CG_NE

410

0,72

0,63

0,458

0,565

0,683

0,571

0,59

0,584

Petroli

NE

Pet_NE

349

0,697

0,61

0,419

0,43

0,678

0,528

0,57

0,009

Rio_Bran

Norte

RB_Norte

407

0,727

0,74

0,342

0,47

0,663

0,486

0,503

0,0009

Boa_Vista

Norte

BV_Norte

399

0,752

0,79

0,338

0,458

0,538

0,502

0,585

0,082

Maringa

S

Mar_S

424

0,808

1,2

0,652

0,753

0,791

0,611

0,765

0,01

Cax_Sul

S

CS_S

347

0,75

0,95

0,446

0,715

0,654

0,559

0,715

0,046

 

 


 






  Inteligência artificial indutiva (Machine Learning) não supervisionada para classificação - Cluster analysis


Cluster e Dendrograma de todas as cidades, programa SAS: ver banco de dados

data cidades;

input Cid_reg $ IDH Rend_Cap Cap_Empr Teci_Emr Org_Prod Ins_Comp;

cards;

Pir_SE 0.785 1.14 0.54 0.695 0.598 0.761??

SC_SE 0.805 1.08 0.686 0.653 0.564 0.788

SJ_SE 0.797 1.17 0.613 0.73 0.597 0.769

MC_SE 0.77 0.65 0.481 0.651 0.549 0.666

Ron_CO 0.755 0.84 0.452 0.509 0.567 0.651

Ana_CO 0.737 0.79 0.481 0.645 0.562 0.708

CG_NE 0.72 0.63 0.458 0.565 0.571 0.59

Pet_NE 0.697 0.61 0.419 0.43 0.528 0.57

RB_Norte 0.727 0.74 0.342 0.47 0.486 0.503

BV_Norte 0.752 0.79 0.338 0.458 0.502 0.585

Mar_S 0.808 1.2 0.652 0.753 0.611 0.765

CS_S 0.75 0.95 0.446 0.715 0.559 0.715

;

proc print;

run;

proc cluster data=cidades outtree = arvore method = average;

var IDH Rend_Cap Cap_Empr Teci_Emr Org_Prod Ins_Comp;

id Cid_reg;

run;

PROC TREE DATA = arvore;

RUN;



 

Ex. Pratico 8 - Alunos procuram exemplo de aplicação de IAI Não Superv. para Agrupamentos e Distâncias Multivariados – Cluster Analysis. Fontes: IBGE, IA, Kaggle, outros repositórios. 

Resolver e fazer relatório. DL: 2/10

 


 Ex. Pratico 9 -  PCA e Cluster Analysis no mesmo banco de dados. DL: 9/10.

PCA com Identificação de Classes

data pira;

input Perfil $ Habitantes IDH Rend_Cap Cap_Empr Teci_Emr

      Gov_Descn Org_Prod Ins_Compet Edu_Empr Geral;

cards;     

Bovino 0.021575 0.6845 0.6425 0.27825 0.4505 0.62075 0.41225 0.50 0.0135 0.454??

Cafe 0.007518421 0.711710526 0.676578947 0.466684211 0.489184211 0.582368421 0.469763158 0.487 0.017421053 0.498947368

Cana_Acu 0.0156 0.753 0.8675 0.268 0.618 0.57 0.42475 0.47325 0.01325 0.47075

Frango 0.014175 0.735 0.8125 0.29175 0.60925 0.56375 0.39975 0.487 0.018 0.4705

Industria 0.083625 0.75275 0.8475 0.43475 0.62025 0.70475 0.56625 0.742 0.03325 0.614

Milho 0.007075 0.74825 0.945 0.281 0.60425 0.5925 0.39125 0.43325 0.005 0.46075

Servicos 0.292975 0.81875 1.6925 0.5335 0.7295 0.739 0.67175 0.77225 0.13925 0.688

Soja 0.01454 0.725 0.788 0.4444 0.5126 0.6618 0.5094 0.5516 0.0008 0.536

Piracicaba 0.0439 0.785 1.14 0.54 0.695 0.796 0.598 0.761 0.004 0.664875

;

proc print;

run;

/* input Perfil $ Habitantes IDH Rend_Cap Cap_Empr Teci_Emr

      Gov_Descn Org_Prod Ins_Compet Edu_Empr Geral; */

proc prinqual plots=(MDPref)

                 /* project onto Prin1 and Prin2 */

              ; /* use COV scaling */

   transform identity(Habitantes IDH Rend_Cap Cap_Empr Teci_Emr

      Gov_Descn Org_Prod Ins_Compet Edu_Empr Geral);  /* identity transform */

   id Perfil;

   ods select MDPrefPlot;

run;

 

Cluster Analysis correspondente a PCA com Identificação de Classes

 

data pira;

input Perfil $ Habitantes IDH Rend_Cap Cap_Empr Teci_Emr

      Gov_Descn Org_Prod Ins_Compet Edu_Empr Geral;

cards;     

Bovino 0.021575 0.6845 0.6425 0.27825 0.4505 0.62075 0.41225 0.5085 0.0135 0.454??

Cafe 0.007518421 0.711710526 0.676578947 0.466684211 0.489184211 0.582368421 0.469763158 0.487 0.017421053 0.498947368

Cana_Acu 0.0156 0.753 0.8675 0.268 0.618 0.57 0.42475 0.47325 0.01325 0.47075

Frango 0.014175 0.735 0.8125 0.29175 0.60925 0.56375 0.39975 0.487 0.018 0.4705

Industria 0.083625 0.75275 0.8475 0.43475 0.62025 0.70475 0.56625 0.742 0.03325 0.614

Milho 0.007075 0.74825 0.945 0.281 0.60425 0.5925 0.39125 0.43325 0.005 0.46075

Servicos 0.292975 0.81875 1.6925 0.5335 0.7295 0.739 0.67175 0.77225 0.13925 0.688

Soja 0.01454 0.725 0.788 0.4444 0.5126 0.6618 0.5094 0.5516 0.0008 0.536

Piracicaba 0.0439 0.785 1.14 0.54 0.695 0.796 0.598 0.761 0.004 0.664875

;

proc print;

run;

/* input Perfil $ Habitantes IDH Rend_Cap Cap_Empr Teci_Emr

      Gov_Descn Org_Prod Ins_Compet Edu_Empr Geral; */

 

proc cluster outtree = arvore method = average;

var Habitantes IDH Rend_Cap Cap_Empr Teci_Emr

      Gov_Descn Org_Prod Ins_Compet Edu_Empr Geral;

id Perfil;

run;

PROC TREE DATA = arvore;

RUN;

 


Ex. Pratico 10 -  Os alunos procuram na Internet um banco de dados para aplicar PCA e Cluster Analysis simultaneamente. no mesmo banco de dados. Discutir os resultados. DL: 16/10.


Exercicio Teórico 3 - IA Supervisionada para Classificação, a matriz de confusão

 Exercicio Teórico 3  - IA Supervisionada para Classificação, a matriz de confusão


Na área de Inteligência Artificial Supervisionada para Classificação, a matriz de confusão é uma ferramenta essencial para avaliar o desempenho de um modelo. Ela é uma tabela que resume os resultados de um modelo de classificação, comparando as classes preditas com as classes reais. A partir dela, é possível calcular diversos parâmetros importantes que fornecem uma visão detalhada sobre o desempenho do modelo.


Parâmetros da Matriz de Confusão

A matriz de confusão mais comum para um problema de classificação binária (duas classes) é representada da seguinte forma:

Classe Predita Positiva

Classe Predita Negativa

Classe Real Positiva

Verdadeiro Positivo (VP)

Falso Negativo (FN)

Classe Real Negativa

Falso Positivo (FP)

Verdadeiro Negativo (VN)

Exportar a Hojas de cálculo

A partir desses quatro valores, são calculados os seguintes parâmetros:

  • Verdadeiro Positivo (VP): O número de instâncias que o modelo classificou corretamente como positivas.
  • Verdadeiro Negativo (VN): O número de instâncias que o modelo classificou corretamente como negativas.
  • Falso Positivo (FP): O número de instâncias que o modelo classificou incorretamente como positivas, quando na verdade eram negativasTambém conhecido como erro do Tipo I.
  • Falso Negativo (FN): O número de instâncias que o modelo classificou incorretamente como negativas, quando na verdade eram positivasTambém conhecido como erro do Tipo II.

A partir desses valores, podemos calcular métricas de desempenho mais sofisticadas:

  • Acurácia (Accuracy): Mede a proporção de classificações corretas (tanto positivas quanto negativas) em relação ao total de classificações. É uma métrica geral, mas pode ser enganosa em dados desbalanceados. Acuraˊcia=VP+VN+FP+FNVP+VN​
  • Precisão (Precision): Mede a capacidade do modelo de não classificar incorretamente uma instância negativa como positiva. Em outras palavras, de todas as instâncias que o modelo previu como positivas, quantas realmente eram positivas. É útil quando o custo de um Falso Positivo é alto. Precisa~o=VP+FPVP​
  • Revocação (Recall) ou Sensibilidade (Sensitivity): Mede a capacidade do modelo de encontrar todas as instâncias positivas. De todas as instâncias que realmente eram positivas, quantas o modelo identificou corretamente. É útil quando o custo de um Falso Negativo é alto. Revocac\c​a~o=VP+FNVP​
  • Pontuação F1 (F1-Score): É a média harmônica da precisão e da revocação. É útil quando há um desequilíbrio entre essas duas métricas, fornecendo um único valor que equilibra ambas. Pontuac\c​a~oF1=2×Precisa~o+Revocac\c​a~oPrecisa~o×Revocac\c​a~o​

Exemplo Prático

Imagine que um modelo de IA foi treinado para detectar se um e-mail é spam (classe positiva) ou não é spam (classe negativa). O modelo foi testado com 1000 e-mails, e a matriz de confusão gerada foi a seguinte:

Predito Spam

Predito Não Spam

Real Spam

VP = 90

FN = 10

Real Não Spam

FP = 20

VN = 880

Exportar a Hojas de cálculo

Agora, vamos calcular os parâmetros:

  • Verdadeiro Positivo (VP): 90 (o modelo classificou corretamente 90 e-mails como spam).
  • Verdadeiro Negativo (VN): 880 (o modelo classificou corretamente 880 e-mails como não spam).
  • Falso Positivo (FP): 20 (o modelo classificou incorretamente 20 e-mails como spam, quando na verdade não eram).
  • Falso Negativo (FN): 10 (o modelo classificou incorretamente 10 e-mails como não spam, quando na verdade eram spam).

A partir desses valores, podemos calcular as métricas de desempenho:

  • Acurácia: Acuraˊcia=90+880+20+1090+880​=1000970​=0.97 (ou 97%) O modelo acertou a classificação de 97% dos e-mails.
  • Precisão: Precisa~o=90+2090​=11090​≈0.818 (ou 81.8%) Das 110 vezes que o modelo previu "spam", ele acertou 90.
  • Revocação: Revocac\c​a~o=90+1090​=10090​=0.90 (ou 90%) Dos 100 e-mails que realmente eram spam, o modelo conseguiu identificar 90.
  • Pontuação F1: Pontuac\c​a~oF1=2×0.818+0.900.818×0.90​≈0.857 (ou 85.7%) Este valor representa um bom equilíbrio entre a precisão e a revocação do modelo.

Ao analisar esses parâmetros, você pode determinar o quão bem o seu modelo está funcionando e quais tipos de erros ele está cometendo. Se o custo de um falso negativo (não detectar um spam importante) for muito alto, você pode preferir um modelo com maior revocação. Se o custo de um falso positivo (classificar um e-mail importante como spam) for mais alto, você pode focar em um modelo com maior precisão.

 

quinta-feira, 11 de setembro de 2025

Aula 18/9/2025

 Pauta:

1) Ex. Pratico 6 - Alunos procuram exemplo de repressão múltipla, e IAI Não Superv. para Redução de Dimensão. IBGE, IA, Kaggle, outros repositórios.

Resolver e fazer relatório. DL: 2/10.


2) Mostrar site e HC

3) Anexar ex. PCA pdf - Ex. Prat. 5

4) Ex. Pratico 7  IAI Não S para Agrupamentos e Distancias Multivariados.

DL: 2/10/2025

Inteligência artificial indutiva não supervisionada (Machine Learning) para classificação  - Cluster analysis


5) Escrever resultado de IAI N S para Agruamentos. Ex. Pratico 7.

6) Regra do Nada da Dopamina

7) Ex. PCA e Cluster simultaneamente. Ex. Pratico 9 




Futuro:


- Box Plot para outliers e ransomização

- Pesquisa de dados para Cluster



Exeplo do Richard com proc REG - Errado - Igual resposta em Excel

 options locale=pt_BR encoding=utf8;


ods graphics on;


/* 1) Dados (vírgula decimal) */

data safra_raw;

  length Safra $7;

  infile datalines dsd truncover;

  input Safra :$7.

        Producao :commax20. Importacao :commax20. Consumo :commax20.

        Exportacao :commax20. Est_Inicial :commax20. Est_Final :commax20.;

datalines;

1999/00,31640,9,1770,5,34480,6,7,4666,1,3590,8

2000/01,42289,3,548,8249,34910,26971,5917,748093,3590,8,5600,907094

2001/02,35280,7,362,3,35594,18745,2509,001,5600,907094,3140,718644

2002/03,47410,9,806,2,36917,46298,4050,314,3140,718644,10390,04166

2003/04,42128,5,299,4,38110,43609,4688,384,10390,04166,10019,12157

2004/05,35006,7,596,1,39527,43375,883,273,10019,12157,5211,214825

2005/06,42514,9,1011,3,40033,74267,4340,273,5211,214825,4363,399155

2006/07,51369,9,1164,3,42839,41846,10862,677,4363,399155,3195,503699

2007/08,58652,3,652,0,45408,25419,7368,853,3195,503699,9722,696508

2008/09,51003,8,1181,6,46760,91955,7333,924263,9722,696508,7813,252696

2009/10,56018,1,388,9,49223,93716,10882,38995,7813,252696,4113,925579

2010/11,57406,9,764,1,50653,29893,9278,460964,4113,925579,2353,165682

2011/12,72979,5,776,1,51683,53541,22293,41927,2353,165682,2131,811005

2012/13,81505,7,893,2,52646,63954,26163,44406,2131,811005,5720,62741

2013/14,80051,7,789,2,53520,81956,20882,80599,5720,62741,12157,90186

2014/15,84672,4,315,4,56483,3,30131,3,12158,1,10531,3

2015/16,66530,6,3336,2,56319,14643,18847,28673,10531,05633,5231,423169

2016/17,97842,8,952,5,57547,9,30813,14713,5305,1,15739,35287

2017/18,80709,5,900,7,59048,4,23742,23948,15739,35287,14558,9134

2018/19,100042,7,1596,4,61937,4,41074,0,14558,9134,13186,6134

2019/20,102586,4,1453,4,67021,4,34892,90683,13186,6134,15312,10657

2020/21,87096,8,3090,715167,71168,6,20815,73551,15312,10657,13515,28622

2021/22,113130,4,2615,1,74534,6,46630,3,13515,28622,8095,886219

2022/23,131892,6,1313,2,79465,98265,54634,4,8095,886219,7201,303565

2023/24,115697,2,1644,7,83995,5,38500,9,7201,303565,2046,803565

2024/25,137005,1,1700,0,90298,3,40000,0,1849,603565,10256,40356

;


proc reg data=safra;             

  model Consumo = Producao Importacao Exportacao Est_Inicial;

run;  

        

Exemplo de Regressao Multipla elaborado por Richard Felipe Pereira

 options locale=pt_BR encoding=utf8;

ods graphics on;

/* 1) Dados (vírgula decimal) */
data safra_raw;
  length Safra $7;
  infile datalines dsd truncover;
  input Safra :$7.
        Producao :commax20. Importacao :commax20. Consumo :commax20.
        Exportacao :commax20. Est_Inicial :commax20. Est_Final :commax20.;
datalines;
1999/00,31640,9,1770,5,34480,6,7,4666,1,3590,8
2000/01,42289,3,548,8249,34910,26971,5917,748093,3590,8,5600,907094
2001/02,35280,7,362,3,35594,18745,2509,001,5600,907094,3140,718644
2002/03,47410,9,806,2,36917,46298,4050,314,3140,718644,10390,04166
2003/04,42128,5,299,4,38110,43609,4688,384,10390,04166,10019,12157
2004/05,35006,7,596,1,39527,43375,883,273,10019,12157,5211,214825
2005/06,42514,9,1011,3,40033,74267,4340,273,5211,214825,4363,399155
2006/07,51369,9,1164,3,42839,41846,10862,677,4363,399155,3195,503699
2007/08,58652,3,652,0,45408,25419,7368,853,3195,503699,9722,696508
2008/09,51003,8,1181,6,46760,91955,7333,924263,9722,696508,7813,252696
2009/10,56018,1,388,9,49223,93716,10882,38995,7813,252696,4113,925579
2010/11,57406,9,764,1,50653,29893,9278,460964,4113,925579,2353,165682
2011/12,72979,5,776,1,51683,53541,22293,41927,2353,165682,2131,811005
2012/13,81505,7,893,2,52646,63954,26163,44406,2131,811005,5720,62741
2013/14,80051,7,789,2,53520,81956,20882,80599,5720,62741,12157,90186
2014/15,84672,4,315,4,56483,3,30131,3,12158,1,10531,3
2015/16,66530,6,3336,2,56319,14643,18847,28673,10531,05633,5231,423169
2016/17,97842,8,952,5,57547,9,30813,14713,5305,1,15739,35287
2017/18,80709,5,900,7,59048,4,23742,23948,15739,35287,14558,9134
2018/19,100042,7,1596,4,61937,4,41074,0,14558,9134,13186,6134
2019/20,102586,4,1453,4,67021,4,34892,90683,13186,6134,15312,10657
2020/21,87096,8,3090,715167,71168,6,20815,73551,15312,10657,13515,28622
2021/22,113130,4,2615,1,74534,6,46630,3,13515,28622,8095,886219
2022/23,131892,6,1313,2,79465,98265,54634,4,8095,886219,7201,303565
2023/24,115697,2,1644,7,83995,5,38500,9,7201,303565,2046,803565
2024/25,137005,1,1700,0,90298,3,40000,0,1849,603565,10256,40356
;
run;

data safra;
  set safra_raw;
  Ano = input(substr(Safra,1,4), 4.);
run;

/* 2) Regressão robusta – MM (alta robustez a outliers em X e Y) */
proc robustreg data=safra method=MM
               plots=(rdplot ddplot histogram qqplot);
  model Consumo = Producao Importacao Exportacao Est_Inicial
        / diagnostics leverage itprint;
  id Safra;
  output out=rob_mm
    r=resid_mm sr=stdres_mm weight=weight_mm
    outlier=out_mm leverage=lev_mm pred=pred_mm;
run;

/* 3) Regressão robusta – M (bisquare padrão), com tuning explícito */
proc robustreg data=safra
               method=M(wf=bisquare(c=4.685) scale=med)
               plots=(rdplot ddplot histogram qqplot);
  model Consumo = Producao Importacao Exportacao Est_Inicial
        / diagnostics leverage itprint;
  id Safra;
  output out=rob_m
    r=resid_m sr=stdres_m weight=weight_m
    outlier=out_m leverage=lev_m pred=pred_m;
run;

/* 4) (Opcional) LTS para detecção de pontos de alta alavancagem e FWLS */
proc robustreg data=safra method=LTS fwls
               plots=(rdplot ddplot);
  model Consumo = Producao Importacao Exportacao Est_Inicial
        / diagnostics leverage;
  id Safra;
run;

ods graphics off;