Mostrando entradas con la etiqueta estadística. Mostrar todas las entradas
Mostrando entradas con la etiqueta estadística. Mostrar todas las entradas

15.2.11

1603.- Por qué no los vemos? - CdM XI

Por tercera vez en los últimos cinco años (cuarta, si cuento otra universidad) me toca dar un curso de probabilidades y estadísticas. Así que es hora de buscarme nuevas historias para contar (el público siempre se renueva... al menos en la mayor parte, pero soy yo el que comienzo a aburrirme).

* * *


Abraham Wald era austro-húngaro (estrictamente, rumano). Un dato menor, sobre alguien conocido por sus trabajos en estadística, pero otro de la larga lista de científicos de primer nivel que estaban activos durante la segunda guerra mundial trabajando para los yanquis.

Por ejemplo, von Neumann, von Karman, Wigner, Teller, Szilard... todos ellos húngaros, podrían haber desarrollado la bomba en Europa, y hoy otra sería la historia del mundo.

Cuentan que cierto día, hablando en Los Alamos durante un almuerzo sobre la existencia o no de extraterrestres, todos coincidían en que debía haberlos. Fermi había hecho rápidamente uno de sus famosos cálculos, conocidos hoy como problemas de Fermi (¿cuántos pianistas hay en California?), y veía que el resultado chocaba con los datos observacionales. Y formuló su paradoja:


Si la probabilidad de que los haya es tan alta, ¿por qué no los vemos?


Se dice, también, que Leo Szilard estaba presente y respondió:

Ya están entre nosotros, y se llaman húngaros!


* * *


Es difícil preguntarse -y más, responder honestamente- sobre lo que no vemos. Hace poco leía una discusión en uno de los blogs que sigo, y era clarísimo cuánto cambiarían las posturas -y sobre todo, los argumentos absurdos- si se hubiese preguntado por la existencia de extraterrestres.

Pero no siempre es fácil abstraerse de las ideas preconcebidas que tenemos, y tendemos a pensar que lo que no se observa, no existe. Pensar con claridad es difícil cuanto más visceral es el tema, y tal vez por eso fue alguien de afuera quien miró correctamente una imagen como la siguiente:



Wald estaba en Columbia, y les cayó como problema analizar el efecto de los impactos en los aviones militares, ya sea para cambiar las tácticas de combate, o para reforzar partes del fuselaje. El MacTutor dice sólo "He used his statistical expertise to develop a method to estimate aircraft vulnerability". Si alguien se quiere bancar las cuentas, un análisis sobre su trabajo puede verse en el JASA (los que no tengan acceso, lo pueden bajar de la página de uno de los autores). También están las casi 100 páginas del original, dando vueltas vía la wikipedia.

La imagen anterior es de Cameron Moll, Wald recibió tablas de datos, y en su trabajo se ve claramente cómo dividió el avión en sectores y contó los impactos que se observaban en los que volvían de distintas misiones.

La propuesta de Wald, brevemente, fue proteger más las áreas menos golpeadas... lo cual puede parecer absurdo, pero no lo es. Su razonamiento era lógico:
Lo que no vemos, justamente, puede ser lo más importante.


* * *


Los aviones analizados eran los que volvían, pero suponiendo que los impactos se distribuían por igual, eso indicaba que no volvían los aviones que recibían los disparos en las zonas que quedaban con menos marcas.

Las objeciones sobre su suposición son vacías: en la época, sin radares ni métodos de precisión para disparar, con vuelos nocturnos y disparos a ciegas desde las defensas en tierra (basados más en barreras de fuego que en apuntarle a los objetivos), uno esperaría una distribución uniforme de los disparos.

Estadísticamente, se estaba metiendo con los llamados datos censurados, afectados en este caso por el -muy literal- survivor bias.

No era el primero, claro: Daniel Bernoulli, doscientos años antes, había incursionado en el tema. Pero esa es ya otra historia.


Post para la Edición 2.1 del Carnaval, esta vez en el blog de su fundador: Tito Eliatron

18.12.10

1595.- Problem(it)a: encuesta paradójica - CdM IX

[si no fuera por el Carnaval, no se si estos últimos meses hubiese posteado algo... Por cuestiones de tiempo, el blog entró en una lenta agonía pero no encuentro la forma menos dolorosa de sacrificarlo, veré qué pasa el año próximo.]

El siguiente problem(it)a, cuyo origen prefiero esconder así uno lo medita un rato, mezcla resultados de la teoría de la medida con otros de la teoría de elecciones (como el de Arrow al que hacía referencia en el post anterior).

Supongamos que N personas están formados en una fila para votar por Xérez o Yérez, ganará el que saque más votos, y varios encuestadores se acercan a preguntarles por su intención de voto.

Ahora:

  • i.- cada encuestador consulta un "segmento" de personas: elige una, y le va preguntando consecutivamente a todas hasta que para en alguna otra; distintos encuestadores se pueden "superponer" y preguntarle a las mismas personas.


  • ii.- todas son encuestadas al menos una vez, y dicen la verdad.


  • Supongamos que los encuestadores se juntan y comparan sus porcentajes de votos (pero no revelan a quiénes les preguntaron):

  • 1.- Si cada encuestador obtuvo que el candidato Xérez saca más de la mitad de los votos de las personas que encuestó, ¿alcanza para afirmar que gana Xérez?


  • 2.- ¿Cuál es el porcentaje mínimo que debería tener Xérez en cada encuesta para poder afirmar que gana?


  • * * *


    Bien: 1 es fácil, 2 no tanto. No hago comentarios para no revelar la solución.

    Para el Carnaval, esta vez en la trébede.

    24.9.10

    1587.- Turing, probabilidades, y estadistica (CdM-VI)

    La vida de Alan Turing es una de las más variadas entre las de los distintos matemáticos del siglo XX. Hay mucha información dando vueltas referida a su influencia en la lógica y la computación, y su nombre sobrevivirá unido al test y las máquinas de Turing.

    En general, se suele hablar de su trabajo en Bletchley Park en relación a quebrar los códigos alemanes, y ahí es donde suele haber una confusión: no llegó a ese lugar por la lógica o la computación (que estaba en pañales, aclaremos), sino por su trabajo previo en una oscura rama de la matemática que pocos entendían en esa época. Aunque sí usó la lógica en cierto momento...



    Una anécdota donde usó la lógica.

    Cuenta Lipton en The P=np Question and Godel's Lost Letter la siguiente historia: después de Dunkerque los ingleses esperaban la invasión alemana. Entre otras medidas, crean la Home Guard para entrenar civiles, y como Turing no sabía manejar un arma, se acercó (voluntariamente) a recibir instrucción militar. Allí, llenó un formulario que terminaba:

    Usted comprende que al firmar este formulario puede ser convocado al ejército en cualquier momento.


    Turing firmó, pero aclaró: "No".

    Tiempo después fue convocado, y si bien por su trabajo (ultrasecreto) no necesitaba ni presentarse, fue sonriente a la entrevista con el oficial, se negó a entrar al ejército, y cuando éste le indicó que había firmado aquel formulario, Turing le dijo que había respondido "No". Seguramente el caso se resolvió más arriba, pero según Lipton, parece que lo sacaron a patadas de esa reunión.



    Sus matemáticas.

    Pero volvamos al objeto del post, que para anécdotas divertidas, ya contamos aquella de cuando conoció a James Bond (bue, a Ian Fleming, el papá)... hace ocho años!!

    En este caso quiero retroceder a 1934, cuando termina sus estudios y decide postularse como Fellow en Cambridge. Como se les pedía a los postulantes evidencia de investigación individual, escribe un paper sobre un tema que hoy se enseña en casi todas las universidades del mundo (y no solo en ciencias, también en carreras de Ingeniería y Económicas): la gaussiana (vayan a verlo... es el original!).

    Los resultados de Turing en este trabajo no son menores: demuestra el Teorema Central del Límite para 'varianzas dominadas' (para abreviar, es casi la condición de Lindeberg, de 1922), demuestra una versión más débil del Teorema de Cramer (si la suma de X e Y es normal, y son independientes, ambas son normales, Cramer 1936), y analiza la casi-suficiencia de su condición para que valga el TCL (se anticipa a la condición de Feller-Levy, 1936).

    Pensemos, para situar sus resultados, que Cramer, Levy y Feller ya estaban doctorados, y trabajaban en estos problemas desde hacía tiempo.




    La época.

    Europa, década del '20. La teoría de probabilidades recién empezaba a formalizarse, ni hablemos de la estadística. Apenas un puñado de matemáticos en distintos lugares tenía alguna idea de probabilidades, y no coincidían ni en los métodos, ni en las implicaciones prácticas de sus teoremas. Las versiones de Borel, von Mises y Kolmogorov se disputaban el lugar de la verdadera teoría de probabilidades.

    Había acuerdo sobre el caso finito, basado en la combinatoria, y desde Laplace que se lo comprendía. Ya Bernouilli con sus ensayos, de Moivre, Euler, Poisson... habían hecho contribuciones al caso discreto, pero el continuo era un mundo aparte.

    Por ejemplo, Hardy había doctorado a Harald Cramer en 1917, en teoría de números. El propio Hardy le señaló a Cramer, diez años después, que en Inglaterra ni siquiera había libros sobre probabilidades, y le sugirió traducir sus notas al inglés. Ahí se origina su The Elements of Probability Theory and Some of Its Applications, y más adelante, un clásico que hasta hoy se consigue.

    En la década del '30 aparecerían por fin los matemáticos que moldearían la probabilidad y la estadística: Paul Lévy, Bernstein, Khinchin, Fisher, Neyman, Pearson y Feller.

    Turing bien pudo formar parte de ese grupo, pero no consiguió nadie en Inglaterra (en 1935) capaz de evaluar su trabajo. Sí consiguió el ingreso a Cambridge, y se inclinó por la lógica.

    Y el resto es historia (más o menos) conocida.


    (post para el VI Carnaval de Matemáticas, esta vez recopilado por Sangakoo)

    12.7.10

    1576.- Una en mil años

    Me causó gracia esta semana ver a varios blogs de los autodenominados científicos comentando el tema del pulpo, pidiendo racionalidad, ofendidos por el espacio que le dedicaron los medios, las relaciones con la pseudociencia...

    Pero a ninguno de ellos se les ocurrió tratar el fenómeno científicamente. Al contrario, se limitaron a afirmar dogmáticamente que el pulpo no puede adivinar, y que acertó por casualidad.

    * * *


    Lo cual seguro que es así, aclaremos, lo comparto. El problema, por si alguno se anima, es cómo demostrarlo 'científicamente'.

    * * *


    El saldo, hoy, es que acertó 8 partidos consecutivos. Si suponemos que tenía un 50-50 de acertar o no cada uno, la probabilidad de que esta seguidilla ocurriera es de 1 en 256. Si contamos que los mundiales se juegan cada cuatro años, no esperemos que se repita en los próximos mil años.

    Esos son los hechos, y los números, matemáticamente hablando. Pero los números en sí no nos dicen mucho más.

    * * *


    Una herramienta para interpretar los números es la estadística. Ocho casos son pocos, nos dirá un profesional del tema, pero si quieren que intentemos algo...

    En este post de Quants Argentina lo hicieron: una cazuela de pulpo con test de hipótesis.

    Ya revisé las cuentas, que pueden ver en su post, y actualizándolas tras la final, si la hipótesis nula (la que se asume verdadera, y que necesitaríamos mucha evidencia para rechazarla) es que el pulpo acierta con probabilidad 1/2, la conclusión es que deberíamos rechazarla, incluso si trabajáramos a nivel 0,5%
    (lo usual es 5% ó 1%).

    * * *


    Los test de hipótesis son parte de la teoría de la decisión. Se merecen un post aparte, pues aunque el test rechace la hipótesis nula, es posible que nos estemos equivocando y la hipótesis sea verdadera.

    Claro que en este caso la probabilidad es baja, 1 en 256... pero aún así resulta mucho más creíble que el test se esté equivocando y no que el pulpo prediga los partidos.

    1.4.10

    1560.- El mejor dia para revisar el arXiv (II)

    El otro paper que quería linkear tiene este abstract:


    The zombie menace has so far been studied only qualitatively or through the use of mathematical models without empirical content. We propose to use a new tool in survey research to allow zombies to be studied indirectly without risk to the interviewers.

    http://arxiv.org/abs/1003.6087



    El paper vale la pena, bajen el pdf y lean que es corto. Genial la imagen de Google Trends, donde se ve cómo el interés en los zombies está a la par que el interés en aliens (pero por debajo de fantasmas).

    Sin embargo, ahí detecto una leve falla en el paper: uno no se preocupa por un zombie suelto, los piensa siempre en plural, y ahí las cosas cambian:



    Sorpresivamente, los zombies rankean primeros en el último tiempo!

    Y lo más importante, que me cuesta creer pero voy a tratar de ver cómo se entiende, es que los vampiros estén tan abajo: después de la trilogía reciente de S Meyer1, o las películas basadas en ella (o los viejos de Anne Rice2, y sus correspondientes películas), o la cantidad de películas con el tema de hombres lobo y vampiros (como esa otra trilogía de Inframundo, enorme desperdicio de celuloide y espacio en dvds... alguien que les avise que se puede filmar en color!!, o la trilogía en papel / cine del ruso que no puedo escribir acá sin copipastearlo -bastante buena, me falta leer el tercero- Sergei Lukyanenko)

    * * *


    Al autor lo linkeo aquí a la derecha, desde hace rato, es Andrew Gelman, del blog Statistical Modeling, Causal Inference, and Social Science.

    * * *


    Para más info en temas relacionados, el año pasado salió un lindo paper de la gente de Google, Predicting the present with Google trends, acá tienen el pdf si no me creen. Eso sí, tuvieron la precaución de datarlo el 10 de abril y no el 1ro!

    * * *


    (1) Confieso: los leí a los tres.

    (2) Estos no los leí.

    (3) No hay una cita 3, ni un tercer post en la serie, pero sería para este paper: A New Figure of Merit for Dark Energy Studies, que posee la frase genial:

    Lorentz violating Chuck Norris in space, breathing aether and watching galaxies with his naked eyes.


    Fue detectado primero por otro blogs de los aquí linkeados, su autor es Julianne

    24.11.07

    1344.- Por que se utiliza la distribucion normal

    Es bastante conocida la historia: en estadística se estudia mucho la distribución normal (la campanita de Gauss) porque es la más utilizada en la práctica.

    Y en la práctica se la utiliza... porque está muy estudiada por la gente de estadística.

    Por suerte, en el libro Probabilidad y Estadística Elementales para Estudiantes de Ciencias, de Maronna, le dedican una sección al tema, y explican la posta. La copio acá porque no es usual encontrar el tema tan bien explicado:

    Muy tarde por la noche el Mulá Nasrudin se encuentra en la calle dando vueltas alrededor de una farola, mirando hacia abajo. Pasa por allí un vecino.

    -¿Qué estás haciendo Nasrudín, has perdido alguna cosa?- le pregunta.
    -Sí, estoy buscando mi llave.

    El vecino se queda con él para ayudarle a buscar. Habiendo buscado durante un largo rato acaban por cansarse, y el vecino pregunta:

    -Nasrudín, ¿dónde estabas cuando la perdiste?
    -Dentro de mi casa.
    -Entonces, ¿por qué la estamos buscando aquí?
    -Pues porque aquí hay más luz.

    3.6.07

    1276.- Cogitating monkeys can calculate statistics

    dice el artículo de Nature de Tianming Yang y Michael Shadlen de esta semana, según el cual los macacos Rhesus son capaces de hacer inferencias estadísticas. Como en Nature no encuentro el link todavía, los dejo con la versión de NewScientist. Act.: link en Nature

    \\

    En otro orden de cosas, conocer el primer diez por ciento de mesas escrutadas según los cómputos oficiales se demoró casi tres horas. El partido del candidato que ocupó el tercer lugar afirmó según bocas de urna haber obtenido el segundo puesto, mientras que el que realmente ocupó el segundo puesto cree poder dar vuelta en el ballotage una diferencia de -apenas (?)- el 20 por ciento de los votos.