Programas para trabajar con datos (Análisis, transformación, etc)
#41
Reporte del estado del arte en ML y Data Science por Kaggle: https://www.kaggle.com/surveys/2017

Y no tenía ni idea de que Excel tenía una suite para ML y Data science, lo que pasa que veo que hay que usar MSSQL y buf, perezote, y caro.
Reply
#42
(30-10-2017, 07:11 PM)Silvio Wrote: Reporte del estado del arte en ML y Data Science por Kaggle: https://www.kaggle.com/surveys/2017

Y no tenía ni idea de que Excel tenía una suite para ML y Data science, lo que pasa que veo que hay que usar MSSQL y buf, perezote, y caro.

No sé qué tanto me fío :/. ¿Por qué pusieron por ejemplo Bitbucket y al mismo tiempo git y Mercurial? ¿Por qué metieron en un  mismo bucket C, C++ y C#? Hay algunas cosas raras entre las opciones de esa encuesta.
Reply
#43
Ni serda
Reply
#44
"What language would you recommend data scientists learn first?" English.
Reply
#45
Dejo esto aquí porque quiero seguirle la pista: http://www.luna-lang.org

https://news.ycombinator.com/item?id=14612680
Reply
#46
Duda de retraso mental.

> pnorm(c(60,150), mean=120, sd=30, lower.tail=FALSE)
[1] 0.9772499 0.1586553


Estos valores que me da son: 0'9772499 para 60, o sea, de 60 para arriba, y 0.1586553, o sea, el 150 para arriba...

Me piden la posibilidad entre 60 y 150, ¿restar las probabilidades y ya, no? Lo ziento, de verdah xd Pero quiero asegurarme. Y también estoy con el Metrix, van a ser risas.
[align=center]
"I a vegades, contra tot pronòstic una gran bestiesa capgira allò que crèiem lògic, tot fent evident, que per un moment, ens en sortim".[/align]
Reply
#47
La probabilidad, en efecto, es la diferencia entre el intervalo mayor y el intervalo menor. En este caso, y creyéndome de que se trata de una N(120,30), entiendo el primer valor es P(N < 150) y el segundo P(N < 60), así que sí, restas el mayor menos el menor.
Reply
#48
Es posible que alguna vez os hayáis encontrado en la situación de hacer un vlookup con similar match en Excel, y habréis caído que la fórmula funciona como le peta. He encontrado esto: https://www.excel-university.com/perform...-in-excel/

Eso algo parecido a un algo de fuzzy logic.
Reply
#49
@hijitus sabes alguna manera de detectar fácil non-breaking whitespaces en CSVs? Algo de andar por casa pero facilongo.
Reply
#50
Querés detectarlos para borrarlos o qué.
Reply
#51
(16-03-2018, 10:05 PM)Manneken Pis Wrote: Querés detectarlos para borrarlos o qué.

Ciertamente, pero a veces no me doy cuenta y me vuelvo loco pensando que estoy haciendo algo mal con regex xd
Reply
#52
https://www.mrexcel.com/forum/excel-ques...space.html

https://techsupport.osisoft.com/Troubles...KB/KB01372


Abrir el csv con excel y probar la mierda esta?

O tírate un sed 's/\xA0//g' fichero.csv aer si cuela loko
Reply
#53
(16-03-2018, 10:31 PM)Manneken Pis Wrote: https://www.mrexcel.com/forum/excel-ques...space.html

https://techsupport.osisoft.com/Troubles...KB/KB01372


Abrir el csv con excel y probar la mierda esta?

O tírate un sed 's/\xA0//g' fichero.csv aer si cuela loko

Mmm la idea era más bien usarlo con sublime text, porque si busco \u00A0 no aparece nada, a pesar de que los espacios están ahí. Podría abrir excel y toda la movida, pero si fuese el caso de que hiciese eso probablemente ya me habría dado cuenta, la idea era hacerlo rápido.
Reply
#54
¿Con el sed tampoco cuela? Con un archivo que he probado funcionaba.
Reply
#55
(17-03-2018, 12:24 AM)Manneken Pis Wrote: ¿Con el sed tampoco cuela? Con un archivo que he probado funcionaba.

No sé de lo que me hablas, muchacho.

Edito: Ya sé de lo que me hablas, pero estoy em guindows cuando tengo estos problemas.
Reply
#56
Entonces soy un inútil, melenas. Pero si sueles tener estas mierdas, y controlas de regex, métete un Cygwin o algo para poder usar los comandos xulos desde guindows.
Reply
#57
(17-03-2018, 12:44 AM)Manneken Pis Wrote: Entonces soy un inútil, melenas. Pero si sueles tener estas mierdas, y controlas de regex, métete un Cygwin o algo para poder usar los comandos xulos desde guindows.

Buscaré, porque cygwin me da aún más pereza, la última vez que lo probé tuve todo tipo de problemas.
Reply
#58
Je, yo iba a decirte lo mismito que Manneken. Para estas cosas, sed es tu amigo fiel.
Reply
#59
Aprovecho para ver si se os ocurre algo:

Necesito coger una lista enorme de palabras clave y hacer bins de las que sean de la misma tematica.

He probado con un tema de similarity hashing, pero de pena. He probado con topic modelling pero me sale muy weirdo. Se me ha ocurrido hacer hoy por la tarde algo con k-medios pero no se como enfocarlo aún.

Es algo que normalmente haria a mano pero son más de 2000 y no quiero morir.

No sé si habéis jugado alguna vez con estas cosas.
Reply
#60
Yo hice una prueba de conceptos de algo parecido usando K-means y n-grams y funcionó más o menos bien. En mi caso eran blog posts. Y me pasé la mayor parte del tiempo probando distintos hiperparámetros.

¿Por qué te salió weirdo?
Reply


Forum Jump:


Users browsing this thread: 2 Guest(s)