segunda-feira, 25 de março de 2024

Videoaulas de Regressão - Macro em Excel - EXCEL - AVANÇADO Base para Machine Learning Supervisionado para Previsão ou Predição

  Videoaulas de Regressão - Macro em Excel  - EXCEL  - AVANÇADO  Base para Machine Learning Supervisionado para Predição



  Videoaulas de Regressão - Macro em Excel  - EXCEL 

                                            AVANÇADO


Base para Machine Learning Supervisionado para Previsão





Videoaula 1 - Resolvendo Graficamente e Sem Probabilidade 
( Sem Macros em Excel)

https://www.youtube.com/watch?v=HWnrEfMHOZw&feature=youtu.be





Videoaula 2 - Resolvendo com Probabilidade, Margem de Erro e Margem de Confiança, Inferência Estatística - Macro de Regressão em Excel


https://www.youtube.com/watch?v=qLbziQKSeB8&feature=youtu.be


 Propaganda - Vendas 

X

Y

30

430

21

335

35

520

42

490

37

470

2

210

8

195

17

270

35

400

25

480





Programa SAS para Regressão


data regre;
input X Y;
cards;
30 430
21 335
35 520
42 490
37 470
2 210
8 195
17 270
35 400
25 480
;
/* Modelo
    Y = X + Erro
    Y = a + b X + Erro
*/    
proc reg;
model Y = X;
run;






Resolvendo no SAS com Ciência de Dados Robusta - Programa e Dados com Outlier

data propaganda;
input X Y;
cards;
30 430
21 335
35 520
42 490
37 470
2 210
8 195
17 270
35 400
25 480
3 800     (===> Outlier) não colocar isto no          programa SAS
;
proc print;
run;
proc robustreg;
model Y=X;
run;



Arquivo para Download








Coeficiente Angular ou Coeficiente de Regressão = 8,3
Quanto aumenta a Venda (Y) quando incremento uma unidade em Propaganda (X)

 

 

Coeficiente Linear = 170,78

Indica quanto venderei em cada unidade de negócio se não fizer propaganda (X=0) 



     Coeficiente de Determinação ou R Quadrado 

Se Coef. Determinação:
0-0,2 = Muito Ruim o Modelo
0,2-0,4 = Ruim
0,4-0,6 = Regular (nem bom nem ruim)
0,6-0,8 = Bom
0,8 - 1 = Muito Bom


coeficiente de determinação, também chamado de , é uma medida de ajustamento de um modelo estatístico linear generalizado, como a Regressão linear, em relação aos valores observados. O R² varia entre 0 e 1, indicando, em percentagem, o quanto o modelo consegue explicar os valores observados. Quanto maior o R², mais explicativo é modelo, melhor ele se ajusta à amostra.
Por exemplo, se o R² de um modelo é 0,8234, isto significa que 82,34% da variável dependente (Y) consegue ser explicada pelos regressores (X) presentes no modelo. Fonte Wikipedia.



Regressão Linear é um dos modelos mais atrativos devido a sua representação entendível, no caso da regressão linear simples sua utilização é mais para aprendizado, já que na prática ela não é muito aplicada, visto que, em muitos casos a gama de variáveis de entradas é maior, fazendo-se uso da Regressão Linear Multivariável, ao qual não adentraremos nesse post. O modelo de representação da regressão linear simples é a tradicional equação conhecida como equação da reta ou em inglês slope-intercept form, usaremos a notação mais utilizada em exemplos de Machine Learning e não da matemática, mas você pode saber mais sobre a própria equação neste link.
Temos o y a variável dependente que representa a predição, as letras gregas β (Beta), também conhecidos como coeficientes, que são a representação das variáveis que o algoritmo irá utilizar para “aprender” a produzir as previsões mais precisas e o x a variável independente que representa o dado de entrada. As letras gregas β também são conhecidas como inclinação e interceptação ou em inglês intercept-slope.

Função de custo


Função de custo, no inglês cost function ou ainda ordinary least squares é uma função utilizada para medir o quão errado o modelo está, os chamados resíduos. Isto é, consiste no cálculo da distância de cada ponto (distância essa entre as variáveis x e y) em relação a reta de regressão, esse valor é elevado ao quadrado e somado, o total é a quantidade média de erro do modelo.

Exemplo de Regressão no Excel com Outlier - Ciência de Dados Robusta - ML S para Predição

  



Exemplo de Regressão no Excel com Outlier - Ciência de Dados Robusta - ML S para Predição




 Colocando Outlier no Exemplo - Cuidado !!!

          Outlier - Dado Fora de Contexto:

·        Destrói Tudo o que pode ser feito em Excel;

·       Destrói tudo o que aprenderão na Graduação e Pós-graduação nos Programas Atuais da USP em Piracicaba (tirando minhas disciplinas).

·        Difícil visualizar Outlier em Big Data:

o   Como Resolver

o   CD Robusta – Em SAS, R ou Python. Rodar antes da IA, critério de seleção de Variáveis Preditoras, por exemplo antes de rodar no Weka.


 

 

Dados para Importar:

Programa SAS para Rodar Ciência de Dados Robusta

(Regressão Robusta)

 Propaganda - Vendas 
Sem Outlier

X

Y

30

430

21

335

35

520

42

490

37

470

8

195

17

270

35

400

25

480

12

258

10

205




X            Y

2          858     Cuiabá


Data Propagan;

Input X Y;

Cards;

30 430

21 335

35 520

42 490

37 470

2 858

8 195

17 270

35 400

25 480

;

proc print;

run;


Proc Robustreg;

  Model Y = X  / Diagnostics;

Run;

 






















Resultado RobustReg sem Outlier














segunda-feira, 18 de março de 2024

Aula 18/3/2024

 Pauta

- Rodar ML Não S para Classificação - Culster Anaysis -

IA Indutiva Nao Supervisionada para Classificção

 Exercício 3 Pratico

Exercício Pratico 3 - Rodar IANão S para Classificação. Somente trocar os sinais de interrogação por ultimos digitos do RG.  DL: 1/5


- Rodar Seleção de Variáveis Preditoras para IA

 Exercício Pratico 4 - Rodar ANOVA para seleção de variáveis preditoras, trocando sinais de interrogação. DL: 1/5


- Exemplos de IA de nossa equipe


- Milena em sala? Colocar na lista de frequencia.




Exercícios

 Exercícios

 

Enviar todos os exercícios para e-mail de Exercícios: gestao.estat.cert@gmail.com

        Colocar o número do exercício e o nome do autor no assunto do e-mail.

 

 

Exercícios Teóricos

 Exercício Teórico 1 – Elabore 7 slides sobre os assuntos abordados nos slides acima. 

Qualquer coisa que tenha te interessado. Podem fazer em duplas se não tiver

computadores suficientes. 

Dead Line: 11/3/2024


 Exercício Teórico 2 - Elaborar 5 slides sobre ML Não Supervisionado para Clasificação - Cluster Analysis

 Dead Line: 18/3/2024



Exercicios Praticos

Exercício Pratico 1 - Fazer Data Cruching - Pivot Table do exemplo do blog com os últimos dígitos de seu RG. Elaborar gráficos equalizados e com lay out adequado.

Dead Line: 18/3/2024

 

Exercício Pratico 2 - Criar um sistema de almoxarifado utilizando Pivot Tables.

Dead Line: 18/3/2024


Exercício Pratico 3 - Rodar IANão S para Classificação. Somente trocar os sinais de interrogação por ultimos digitos do RG.  DL: 1/5

data  pessoas;
input cat $ imc corr kcal;
cards;

AT 20.? 54.? 31??

PR 25.3 2.7 2650

SE 25.6 2.9 2700

SEM 23.1 16.6 2950

;
proc cluster data=pessoas outtree = arvore method = average;
var imc corr kcal;
id cat;
run;
PROC TREE DATA = arvore;
RUN;

 Exercício Pratico 4 - Rodar ANOVA para seleção de variáveis preditoras, trocando sinais de interrogação. DL: 1/5

 data People;

/* BMI: body mass index --> Índice de M. Corporal = Peso / (Altura * Altura)
     Movm: Movement (Km por semana)
     KCal : Kilocalories (ingeridas por dia)
     ATL: Athletes
     SEMI: Semi-athletes
     SEDE: Sedentary
     PROF: Professor

*/
input Categ $ IMC Movim Kcal;
cards;
ATL 20.? 60.? 32??
ATL 21.3 54.8 3100
ATL 19.3 49.6 2800
ATL 21.1 52.3 3300
SEMI 22.4 14.9 2600
SEMI 21.9 17.8 2700
SEMI 23.8 18.6 3200
SEMI 24.1 15.1 3300
SEDE  27.3 2.5 2700
SEDE 23.4 4.3 2300
SEDE  25.2 2.3 2600
SEDE  26.4 2.6 3200
PROF 26.2 4.1 2600
PROF 24.2 2.1 2700
PROF 25.4 1.9 2650
;
Proc ANOVA;
     Class Categ;
      Model IMC Movim Kcal = Categ;
     Means Categ / Duncan Lines;
Run;


 Exercício Pratico 5 - Rodar o exemplo de propaganda e vendas com seu numero de RG. DL: 8/4/2024.


X

Y

30

4??

21

3??

35

520

42

490

37

470

8

195

17

270

35

400

25

480

12

258

10

205




X            Y

2          858     Cuiabá