Back to Course

FoSSA Français

0% Complete
0/0 Steps
  1. Information sur le cours

    Rencontrez l'équipe enseignante
  2. Jeu de données du cours 1
  3. Jeu de données du cours 2
  4. MODULE A1: INTRODUCTION AUX STATISTIQUES AVEC R ET STATA
    A1.1 Qu'est-ce que les Statistiques?
  5. A1.2.1a Introduction à Stata
  6. A1.2.2b: Introduction à R
  7. A1.2.2c: Introduction to SPSS
  8. A1.3: Statistiques Descriptives
  9. A1.4: Estimations et Intervalles de Confiance
  10. A1.5: Tests d'Hypothèses
  11. A1.6: Transformation de Variables
  12. Fin du Module A1
    1 Quiz
  13. MODULE A2: CALCULS DE PUISSANCE STATISTIQUE & DE TAILLE D’ÉCHANTILLON
    A2.1 Concepts Clés
  14. A2.2 Calculs de puissance pour une différence de moyennes
  15. A2.3 Calculs de puissance pour une différence de proportions
  16. A2.4 Calcul de taille d’échantillon pour les essais randomisés (RCTs)
  17. A2.5 Calculs de taille d’échantillon pour les études transversales (ou sondages)
  18. A2.6 Calcul de taille d'échantillon pour un devis cas-contrôle
  19. Fin du Module A2
    1 Quiz
  20. MODULE B1: RÉGRESSION LINÉAIRE
    B1.1 Corrélation et Nuages de Points (scatterplots)
  21. B1.2 Différences Entre Moyennes (ANOVA à un facteur)
  22. B1.3 Régression Linéaire Univariée
  23. B1.4 Régression Linéaire Multivariée
  24. B1.5 Sélection de Modèles et Tests F
  25. B1.6 Diagnostics de Régression
  26. Fin du Module B1
    1 Quiz
  27. MODULE B2: COMPARAISONS MULTIPLES & MESURES RÉPÉTÉES
    B2.1 ANOVA Approfondie— Tests Post-Hoc
  28. B2.2 Correction pour Comparaisons Multiples
  29. B2.3 ANOVA à deux facteurs (Two-way ANOVA)
  30. B2.4 Mesures Répétées et Test T Apparié
  31. B2.5 ANOVA pour Mesures Répétées
  32. Fin du Module B2
    1 Quiz
  33. MODULE B3: MÉTHODES NON-PARAMETRIC
    B3.1 Hypothèses des Tests Paramétriques
  34. B3.2 Test U de Mann-Whitney
  35. B3.3 Test de Kruskal-Wallis
  36. B3.4 Test des rangs signés de Wilcoxon
  37. B3.5 Test de Friedman
  38. B3.6 Corrélation des Rangs de Spearman
  39. Fin du Module B3
    1 Quiz
  40. MODULE C1: DONNÉES BINAIRES & RÉGRESSION LOGISTIQUE
    C1.1 Introduction à la prévalence, au Risque, aux Cotes (Odds) et aux Taux
  41. C1.2 Le Test du Chi Carré & le Test de Tendance
  42. C1.3 Régression Logistique Univariée
  43. C1.4 Régression Logistique Multivariée
  44. Fin du Module C1
    1 Quiz
  45. MODULE C2: DONNÉES DE SURVIE
    C2.1 Introduction aux Données de Survie
  46. C2.2 Fonction de Survie de Kaplan-Meier & Test du Log-Rank
  47. C2.3 Régression de Cox à Risque Proportionnel
  48. C2.4 Régression de Poisson
  49. Fin du Module C2
    1 Quiz
Lesson 5 of 49
In Progress

A1.2.1a Introduction à Stata

Résultats d’apprentissage

À la fin de cette session, les personnes étudiantes seront capables de :

  • Ouvrir des ensembles de données dans le logiciel statistique de leur choix
  • Explorez des ensembles de données et comprendre quelles données ils contiennent.
  • Utilisez les commandes de base pour modifier leurs données.

Vidéo A1.2.1a – Bienvenue dans Stata I (4 minutes)

Inutile de réinventer la roue, regardez plutôt la vidéo d’introduction officielle de Stata ici Stata’s official introductory video here. Elle vous présentera les différentes fenêtres de l’interface Stata qui s’affichent lorsque vous ouvrez le logiciel.

Vidéo A1.2.1b – Bienvenue dans Stata  II (9 minutes)

A1.2.1a PRACTICAL: Premier pas avec Stata

Trouvez votre fichier de données

Télécharger votre ensemble de données et enregistrez-le sur votre ordinateur. Notez l’emplacement de l’ensemble de données et le chemin d’accès au fichier.

Ouvrez Stata

Stata peut être ouvert soit à partir de l’icône sur le bureau, soit via le menu « Démarrer », comme pour les autres programmes Windows. Une fois ouvert, Stata devrait afficher quatre fenêtres (similaires à la capture d’écran dans vos notes de cours). Prenez le temps de vous rappeler la fonction de chaque fenêtre de l’interface Stata.

Ouvrir un fichier do

Créez un fichier do, cliquez sur l’icône « New do file editor » (Nouvel éditeur de fichier do), puis sélectionnez « Save as » (Enregistrer sous) dans l’éditeur de fichier do pour enregistrer le fichier.

Do.png

Assurez-vous que le fichier do est enregistré à la fin de chaque session. Les fichiers do sont essentiels car ils créent un enregistrement permanent de toutes les commandes qui ont été utilisées pour l’analyse statistique. Cela est important car cela vous permet de reproduire rapidement tout votre travail en réexécutant simplement votre fichier do. Si vous n’utilisez pas de fichier do et que vous tapez toutes vos commandes directement dans la fenêtre de commande Stata, aucune de vos commandes ne sera enregistrée et vous devrez tout retaper dans Stata si vous souhaitez répéter la même analyse.

Le code de votre fichier .do peut être exécuté en mettant en surbrillance la commande que vous souhaitez exécuter, puis en cliquant sur le bouton « execute (do) ».

Do2.png

Modifier le répertoire de travail (working directory)

Il est souvent plus facile de démarrer Stata en définissant un répertoire de travail. Le répertoire de travail est le fichier dans lequel Stata recherchera les données d’entrée (c’est-à-dire votre ensemble de données) et dans lequel il enregistrera vos résultats. De plus, en prédéfinissant un répertoire de travail, vous n’aurez pas à saisir le chemin d’accès complet du fichier chaque fois que vous souhaitez charger un fichier.

La saisie des commandes suivantes affichera le nom du répertoire de travail actuel :

pwd

cd

Si vous souhaitez modifier le répertoire de travail actuel, vous pouvez taper la commande suivante (où”filepath” correspond au nom du chemin d’accès complet au dossier dans lequel est enregistré l’ensemble de données « condom study_Stata_MScGHSE ») :

 cd “filepath”

Alternativement, vous pouvez utiliser le menu déroulant pour changer le répertoire de travail et accéder au dossier dans lequel est enregistré l’ensemble de données « condom study_Stata_MScGHSE » (File>Change working directory).

Vous pouvez vérifier le contenu du répertoire de travail en tapant :

dir

Cependant, il peut être préférable de spécifier le chemin d’accès complet à chaque fois que vous ouvrez ou enregistrez un fichier, en particulier si vous utilisez des fichiers provenant de différents emplacements.

Ouvrir un fichier log

Un fichier log est un enregistrement de vos commandes et de leurs résultats (c’est-à-dire les sorties de votre analyse). Vous pouvez ouvrir un fichier log en tapant :

log using “filepathfilename.log”

Par exemple, vous pouvez créer un fichier log dans votre dossier « Document » en tapant (Remplacer “filepath” et  “filename.log” par le chemin d’accès et le nom de fichier appropriés) :

log using “filepathDocumentsfilename.log”

Vous pouvez également passer par le menu déroulant (File > Log > Begin) puis entrer le nom du fichier. Nous recommandons de sauvegarder le fichier log au format non formaté (.log), car ces fichiers peuvent être ouverts dans d’autres programmes, comme Notepad ou MS Word. Par défaut, Stata enregistre les fichiers log au format .smcl, qui ne peut être ouvert que dans Stata.

Ouvrir un fichier log.

Ouvrir votre jeu de données

Vous pouvez ouvrir votre jeu de données en tapant la commande suivante dans la fenêtre de commande:

use “your filename.dta”

Pour aujourd’hui, cela sera :

use “filepath/Whitehall_fossa.dta”

Vous pouvez également ouvrir un fichier à partir du menu déroulant (File > Open), puis naviguer dans les dossiers et sélectionner le fichier approprié. Cette méthode n’est pas recommandée, car elle ne permet pas de conserver une trace des fichiers utilisés dans l’analyse.

Pour ouvrir un jeu de données dans Stata, le fichier doit être au format .dta. Les données peuvent également être importées à partir d’autres logiciels, à condition qu’elles soient dans un format approprié (généralement délimité par des tabulations ou en .csv). Vous trouverez davantage d’informations sur l’importation de données à partir d’autres programmes dans votre document de cours et dans l’aide de Stata.

Prenez un moment pour examiner les variables de votre jeu de données en tapant la commande suivante :

browse

Question A1.2.1a:    Explorer le jeu de données complet. 
o    Combien de lignes (individus ou observations) y a-t-il ? 
o    Combien de colonne (variables) y a-t-il ? 
o    Remarquez le code couleur attribué aux variables ; le code des variables catégorielles étiquetées (en bleu) est visible à l’aide de la fonction browse.
o    Examinez la variable ‘currsmoker’. Est-il clair à quoi correspondent les valeurs ?

A1.2.1a. Réponses

Vous pouvez parcourir l’ensemble de données en ouvrant l’éditeur de données (Data EditorBrowse) :

BR.png

Ou en tapant browse dans la fenêtre de commande.

Vous pourrez alors constater qu’il y a 4 327 lignes et 17 variables — dans ce cas, nous avons des données sur N = 4 327 personnes, et les données sont organisées avec une ligne par individu. Cette information est également accessible en tapant la commande ‘describe’.

Vous pouvez également voir comment la variable appelée ” bmi_grp4 est codée. Les étiquettes de valeurs “underweight” et “normal” (etc.) sont attribuées respectivement aux données codées 1 et 2. La variable ‘currsmoker’ ne possède pas d’étiquettes, il n’est donc pas immédiatement évident à quoi correspondent les valeurs 0 et 1. Remarque : il n’y a aucune variable codée en rouge. Si vous voyez une variable en rouge, il s’agit d’une variable de type chaîne de caractères (string variable). Lorsque vous double-cliquez sur des cellules individuelles, vous remarquerez qu’il n’y a pas de codes numériques sous-jacents pour ces données : elles contiennent uniquement du texte.

Vous pouvez obtenir une partie de ces informations en utilisant la commande describe , bien qu’il soit parfois utile d’examiner les données directement dans l’éditeur de données (data browser).

Vidéo A1.2.1c – Explorer les données dans Stata  (3 minutes)

A1.2.1b PRACTIQUE: Explorer et se familiariser avec vos données

Syntaxe générale

Il existe plusieurs façons de se familiariser avec votre jeu de données. Au fur et à mesure que vous progressez dans cette section, notez que la syntaxe générale des commandes dans Stata est la suivante :

command {space} variable_name(s) {space}  [if expression], {space} options

Notez qu’après la commande et le nom de la variable, une virgule précède toute liste d’options. Certaines commandes peuvent également être abrégées. Les instructions conditionnelles utilisant le mot « if » apparaissent avant la virgule. Gardez cette syntaxe générale à l’esprit lorsque vous utilisez les commandes ci-dessous.

Dépannage – comment obtenir de l’aide

La commande ‘help’ dans Stata peut être très utile pour en apprendre davantage sur les commandes disponibles. Il suffit de taper help suivi du nom de la commande pour laquelle vous souhaitez obtenir plus d’informations ; une fenêtre d’aide s’ouvrira.

Par exemple, si vous souhaitez obtenir plus d’informations sur la commande ‘tabulate’, vous pouvez taper :

help tabulate

Vous pouvez également rechercher une commande. Par exemple, si vous souhaitez obtenir de l’aide générale sur les histogrammes, vous pouvez taper :

search histogram

Explorer vos données

La commande ‘describe‘ permet d’afficher les noms des variables ainsi que leurs étiquettes. Vous pouvez examiner l’ensemble du jeu de données ou des variables spécifiques. Essayez :

describe

describe bmi_grp4

La commande ‘codebook‘ fournit des informations supplémentaires sur les variables du jeu de données, notamment les valeurs minimales et maximales ainsi que des informations sur les données manquantes. Dans Stata, les valeurs manquantes sont généralement codées par un point (.). Toutefois, elles peuvent aussi être codées, par exemple, comme 99 ou 0 ; il est donc important de bien comprendre comment les valeurs manquantes sont codées avant d’explorer votre jeu de données. Essayez :

codebook bmi_grp4

Vous pouvez également vous faire une idée du jeu de données en utilisant les commandes ‘list‘ et ‘tabulate‘. Essayez d’examiner les variables ‘currsmoker’ et ‘frailty’ :

tabulate currsmoker

tab currsmoker, missing

tab currsmoker frailty, row

tab currsmoker frailty, col

Vous pouvez utiliser la condition ‘if ‘ pour visualiser des observations spécifiques. Essayez d’explorer les données pour les fumeurs actuels âgés de 60 à 70 ans :

browse if currsmoker==1 & age_grp==1

Essayez maintenant de tabuler le niveau de fragilité chez les fumeurs actuels âgés de 60 à 70 ans à l’aide de la condition ‘if’ :

tab frailty if currsmoker==1 & age_grp==1

Notez que dans Stata, si vous souhaitez indiquer qu’une variable est « égale à » une certaine valeur, vous devez utiliser deux signes égal, comme ceci : ==.

Question A1.2.1b:  Examiner la variable bmi_grp4.

    • Quelle information est collectée dans variable ?
    • Comment les réponses sont-elles codées ?
    • Y a-t-il des données manquantes ?
A1.2.1b. Réponses

Vous pouvez obtenir des informations sur une variable en utilisant plusieurs méthodes. Par exemple, si vous utilisez la commande ‘codebook’, elle vous affichera les éléments suivants :

bmig.png

Vous pouvez voir ici que la variable est une variable numérique et qu’elle est codée de 1 à 4. Chaque code possède une étiquette associée, de sorte que 1 = « underweight » et 2 = « normal » (etc.). Stata vous indique également qu’il y a 17 valeurs manquantes, représentées par un point (.).

Video A1.2.1d – Modifier et générer des variables dans Stata (5 minutes)

A1.2.1c PRACTIQUE: Éditer, créer et ajuster des variables

Étiquetage des variables

Si vous regardez la fenêtre « Variables », vous remarquerez que certaines variables ne possèdent pas d’étiquettes, ou que le nom de la variable n’est pas très explicite. Les données peuvent être plus faciles à exploiter si vous disposez d’une courte description (ou étiquette) des variables. Vous pouvez ajouter des étiquettes aux variables à l’aide de la commande ‘label variable’.

Syntaxe générale :

 label variable variable_name “label”

Lorsque vous ajoutez une étiquette à une variable, la commande est ‘label variable ‘ ; simplement taper label est incorrect. Par exemple :

label variable prior_cvd “Prior CVD” 

Si vous regardez la fenêtre « Variables », vous devriez maintenant voir qu’une étiquette apparaît à côté de ‘prior_cvd’. Vous pouvez ensuite examiner cette variable en utilisant la commande ‘codebook ‘ ou ‘tab‘ :

 codebook prior_cvd      … (or tab prior_cvd)

Vous pouvez voir que la variable ‘currsmoker’ est une variable binaire et qu’elle prend la valeur 0 ou 1. Cela n’est pas très informatif ; en réalité, 0 = non et 1 = oui. Nous devons donc réétiqueter les valeurs numériques de la variable en “yes” et “no”.

L’étiquetage d’une variable se fait en deux étapes. Tout d’abord, vous devez définir l’étiquette, puis l’assigner à la variable. La syntaxe générale est présentée ci-dessous :

label define label_name 0 “label1” 1 “label2” …[, add modify replace]

label values variable_name(s)  label_name

Pour la variable ‘currsmoker’, nous devons d’abord utiliser la commande ‘label define’ afin de créer une étiquette de valeurs appelée ‘smoke_lab’, qui associe 0 à “no” et 1 à “yes”. Par exemple :

 label define smoke_lab 0 “no” 1 “yes”

Ensuite, nous devons appliquer cette nouvelle étiquette (‘smoke_lab’) à la variable ‘currsmoker’. Par exemple :

label values currsmoker smoke_lab

Examinez maintenant la variable ‘currsmoker’ (avec ‘tab ‘ ou ‘codebook‘) ; vous devriez constater que les valeurs 0 et 1 sont désormais étiquetées “no” et “yes”. Vous pouvez également consulter les étiquettes d’une variable en tapant :

label list label_name

Par exemple, tapez :  label list smoke_lab

  • Pouvez-vous suivre les commandes décrites ici pour étiqueter la variable ‘currsmoker’ dans votre propre jeu de données et votre version de Stata ?

Créer de nouvelles variables – ‘generate’

La commande ‘generate ‘ vous permet de créer de nouvelles variables. La syntaxe générale est :

generate new_variable=expression [if ]

Essayez les commandes suivantes :

generate var1 = 1

generate var2 = 5

browse

Vous pouvez également copier des variables existantes ou créer de nouvelles variables à partir de données existantes. Par exemple :

generate age4 = age_grp

Vous pouvez également utiliser des opérations mathématiques et des fonctions telles que + (addition), – (soustraction), * (multiplication), / (division), ^ (puissance), sqrt (racine carrée), ln (logarithme naturel), exp (exponentielle). Par exemple :

 generate var3 = var1+var2

 gen var4 = var3*var2

Ces calculs peuvent être utilisés pour créer différentes variables. Par exemple, vous pouvez calculer le nombre total de maladies antérieures diagnostiquées chez un participant :

gen prior_disease = prior_cvd + prior_t2dm + prior_cancer

tab prior_disease, m

Il existe également une extension de la commande ‘generate’, appelée ‘egen’, qui peut être utile (voir ‘help egen’ pour plus d’informations).

Remplacer et coder  

Vous pouvez modifier des variables à l’aide des commandes ‘replace’ et ‘recode’. VEUILLEZ NOTER QU’IL EXISTE PLUSIEURS FAÇONS (CORRECTES) DE RECODER ET DE CRÉER DE NOUVELLES VARIABLES. Vous verrez quelques exemples dans cet exercice pratique, et d’autres dans les séances suivantes. Le choix de la méthode pour remplacer ou recoder des variables relève généralement d’une préférence personnelle, et il importe rarement laquelle vous utilisez, car différentes commandes peuvent produire le même résultat.

Essayez de modifier la variable ‘bmi’ afin de créer une variable binaire indiquant les individus obèses et ceux qui ne le sont pas. Toutefois, ne modifiez jamais directement la variable originale (au cas où vous changeriez d’avis).

Dupliquez d’abord la variable, puis recodez-la. Par exemple :

gen bmi2=bmi 

recode bmi2 min/29=0 30/max=1

Comparer maintenant ‘bmi’ et ‘bmi2’ :

 browse bmi bmi2

Voici une autre façon de recoder l’IMC :

gen bmi_bin = 1 if bmi_grp4<=2

replace bmi_bin = 0 if bmi_grp4>2

Il est recommandé de croiser vos variables binaires et catégorielles afin de vérifier votre codage :

tab bmi_bin bmi_grp4, miss

Dans Stata, les valeurs manquantes sont considérées comme les valeurs numériques les plus élevées ; observez donc où elles apparaissent à l’aide de cette commande.

Question A1.2.1c:

    • Pouvez-vous générer une nouvelle variable identique à la variable ‘ldlc’ ? (appelez-la ‘ldl2’)
    • Pouvez-vous recoder cette nouvelle variable afin d’indiquer les individus ayant un LDL-C inférieur ou égal à 4, et ceux ayant un LDL-C supérieur à 4 mmol/L ? (indice : utilisez la commande ‘replace’ comme ci-dessus, avec les signes ‘<=’)
    • Optionnel : examinez la syntaxe de ‘recode’ (tapez ‘help recode’) pour comprendre comment définir des étiquettes de valeurs directement dans la commande.
A1.2.1c. Réponse

Si vous reproduisez la méthode présentée ci-dessus, vous devriez obtenir le résultat ci-dessous. Les étiquettes de valeurs de la nouvelle variable ont également été définies et un tableau a été produit pour vérification :

 gen ldl2=ldlc

replace ldl2=0 if ldl2<=4 

       replace ldl2=1 if ldl2>4

     tab ldl2

 label define ldl 0 “Under 4” 1 “Over 4”

           label values ldl2 ldl

     tab ldl2, m

Notez que, comme pour de nombreuses commandes dans Stata, il existe plusieurs façons correctes de générer une nouvelle variable. L’une de ces méthodes consiste à utiliser la commande ‘recode’.

Si vous utilisez la commande ‘recode’ comme précédemment, l’information recodée est stockée dans la variable à recoder, c’est-à-dire que l’information originale est écrasée. C’est pourquoi nous avons d’abord créé une copie de la variable.

Nous pouvons toutefois sauter cette étape et rendre le code plus efficace en utilisant l’option ‘gen()’ de la commande ‘recode’, comme illustré ci-dessous :

recode ldl2 min/4=0 4.01/max=1, gen(ldl2)

Le code peut être rendu encore plus efficace en combinant l’attribution des étiquettes de valeurs directement dans la commande ‘recode’ :

recode ldlc (min/4=0  “under 4”) (4.01/max =1 “over 4”), gen(ldl2_b)

Supprimer des variables 

Vous pouvez supprimer des variables du jeu de données si vous ne souhaitez plus les utiliser. Cependant, une fois cette action effectuée, elle est irréversible ; soyez donc prudent lorsque vous utilisez cette commande. Une variable peut être supprimée du jeu de données en tapant la commande suivante:

 drop var1

Modifier les données — effectuer des changements dans l’éditeur de données

Stata dispose d’un éditeur de données qui vous permet de visualiser les données de votre jeu de données et d’y apporter des modifications. Pour accéder à cette fenêtre, vous pouvez soit taper ‘edit’, soit l’ouvrir à partir du menu déroulant (Data > Data Editor > Data Editor (Edit)). Vous pouvez ensuite cliquer sur la cellule appropriée dans la fenêtre d’édition et modifier les valeurs des données.

CEPENDANT, lors du nettoyage des données, il est fortement recommandé d’enregistrer les commandes pertinentes dans un fichier .do et de les exécuter à chaque session. Cela permet de conserver votre jeu de données original intact en cas d’erreur lors de l’édition, ou si vous devez vous rappeler ultérieurement des modifications effectuées. Vous disposez ainsi d’un enregistrement permanent du processus de nettoyage des données.

Le « nettoyage des données » (data cleaning) correspond au processus qui consiste à préparer l’ensemble des variables de votre jeu de données brut afin qu’elles puissent être utilisées dans votre analyse.

👋 Before you go, leave an anonymous rating & feedback

Average rating 4.4 / 5. Vote count: 32

No votes so far! Be the first to rate this post.

Please share any positive or negative feedback you may have.

Feedback is completely anonymous

0 Comments
Newest
Oldest Most Voted
Inline Feedbacks
View all comments
0
Questions or comments?x