Estou usando dados do painel e estou tentando mesclar conjuntos de dados de acordo com o ano e a variável id exclusiva. No entanto, minha variável id não é uniforme em todos os conjuntos de dados. Embora reconheça que isso é fundamental para mesclar dados, não sei como resolver esse problema. Estou usando dados para países do mundo, mas nem todos os países são registrados em todos os conjuntos de dados. Para alguns, há mais países incluídos. Atualmente, os dados são classificados pelo ID do país. que é alfabeticamente, e a cada país é atribuído um valor numérico no Stata. Portanto, alguns dos países têm valores diferentes atribuídos a eles de acordo com quantos países existem nesse conjunto de dados específico. E, portanto, quando eu mesclar os dados de acordo com o id para cada país e o ano. estes correspondem a diferentes países. Existe uma maneira de atribuir o mesmo número a cada país e torná-lo uniforme, independentemente do número de países no conjunto de dados solicitado em 19 de maio de 14: 49STATA usa uma função de número pseudo-aleatório uniforme () para gerar números aleatórios..generate randnum uniform () O STATA gera um valor de 16 dígitos no intervalo 0, 1) para cada caso nos dados. Você pode usar esses números para escolher casos (se você escolher aqueles com números aleatórios menores que 0,20, cada caso tem 20 chances de ser selecionado. Note que isso não significa que você selecionará exatamente 20 dos casos). Bem, se você quiser para selecionar aleatoriamente 10 pessoas de uma lista, digamos de 1 a 20. Você pode fazer o seguinte: Limpar dados da memória Diga ao STATA para gerar 20 números para que você possa ter números aleatórios suficientes. Pode não ser o suficiente. Bem-vindo ao Instituto de Pesquisa Digital e Educação Notas da Classe Stata Contando de n para N Introdução O Stata possui duas variáveis internas chamadas n e N. n é notação de Stata para o número de observação atual. n é 1 na primeira observação, 2 na segunda, 3 na terceira e assim por diante. N é notação de Stata para o número total de observações. Vamos ver como n e N funcionam. Como você pode ver, a variável id contém um número de observação de 1 a 7 e nt é o número total de observações, que é 7. Contando com Usando n e N em conjunto com o comando by pode produzir alguns resultados muito úteis. É claro que, para usar o comando by, devemos primeiro classificar nossos dados na variável by. Agora n1 é o número de observação dentro de cada grupo e n2 é o número total de observações para cada grupo. Para listar a pontuação mais baixa para cada grupo, use o seguinte: Para listar a pontuação mais alta de cada grupo, use o seguinte: Outro uso de n Permite usar n para descobrir se há números de ID duplicados nos seguintes dados: as observações 6 e 7 têm os mesmos números de identificação e diferentes valores de pontuação. Encontrando Duplicatas Agora vamos usar N para encontrar observações duplicadas. Neste exemplo, classificamos as observações por todas as variáveis. Em seguida, usamos toda a variável na instrução by e definimos set n igual ao número total de observações que são idênticas. Finalmente, listamos as observações para as quais N é maior que 1, identificando as observações duplicadas. Se você tiver muitas variáveis no conjunto de dados, poderá levar muito tempo para digitá-las todas duas vezes. Podemos usar o curinga para indicar que desejamos usar todas as variáveis. Além disso, nas versões mais recentes do Stata, podemos combinar ordenar e por meio de uma única instrução. Abaixo está uma versão simplificada do código que produzirá exatamente os mesmos resultados acima. O conteúdo deste site não deve ser interpretado como um endosso de qualquer site, livro ou produto de software em particular pela Universidade da Califórnia.
No comments:
Post a Comment