test: sweep seeds, because one seed credited a gain that is not there - #61
Merged
Conversation
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
experiment.pycomparaba variantes con el mismo split y el mismo presupuesto, y hasta ahoracon la misma única semilla. Barriendo 7/13/29/41 sobre las mismas variantes, la dispersión
entre semillas resulta ser tan grande como las ganancias que el proyecto se estaba acreditando:
El
+1.2del bloque de cara era el máximo de cuatro semillas. Su media queda por debajode no tener cara, y qué lado gana cambia con la semilla. El torso se comporta distinto: +0.9 de
media y el mismo signo en tres de cuatro, lo que reproduce el
+1.0que se le atribuía.Ninguna de las dos alcanza significancia con n=4 —el error estándar de una diferencia aquí anda
por 0.008— pero pequeño-y-consistente y cero-y-errático no son el mismo hallazgo.
Lo que decide entre esas dos no es la significancia, es el coste. Los escalares de torso se
derivan de landmarks de pose que el pipeline necesita de todas formas, porque las coordenadas
de mano son relativas al torso: cuestan cinco restas. El bloque de cara cuesta una pasada
entera de
FaceLandmarkerpor fotograma, y los fotogramas por segundo son lo que decide si laapp escribe algo.
Esto no es motivo para borrar el bloque de cara. SWL-LSE es un diccionario: signos aislados
en forma de cita, así que no hay negación, interrogativa ni topicalización que marquen los
rasgos no manuales, y las articulaciones bucales que distinguen signos manualmente idénticos no
aparecen nunca. Lo medido es que esos seis escalares no aportan en este corpus para esta
tarea. La variante más rica,
face points (21 located), también midió peor, lo que se lee comoque no hay datos para aprender la cara, no como un veredicto sobre la cara.
Dos banderas nuevas, y por qué son así:
face_hold_mssimula ejecutar el modelo de cara menos a menudo reteniendo la última lectura.Se pide en milisegundos, no en fotogramas: el corpus va a 20.00 fps y la app no se acerca,
así que "uno de cada tres" son 150 ms aquí y ~600 ms en un móvil. Es la misma trampa que tapó
el bug de los umbrales del segmentador.
use_torsoes independiente deuse_posea propósito. Apagaruse_posese llevaría tambiénla posición de la mano relativa al torso, que es la única ganancia grande (+5.7), así que
medir el torso a través de esa bandera contestaría otra pregunta.
Los logs viven en
tools/train/data, que está en.gitignore, así que los hallazgos van alREADME en vez de quedarse en mi máquina. Y el docblock de
vocabularySignature.tsafirmaba quetodos los elementos se habían ganado su sitio: corregido en el segundo commit.