Reconocimiento de comandos de voz mediante refuerzo de gradiente basado en histograma

Autores/as

  • Teth Azrael Cortes Aguilar Tecnológico Nacional de México. Instituto Tecnológico José Mario Molina Pasquel y Henríquez. Departamento de Sistemas Computacionales y Electrónica. Zapopan, Jalisco, México https://orcid.org/0000-0003-3005-0300
  • Adriana Tovar Arriaga Tecnológico Nacional de México. Instituto Tecnológico José Mario Molina Pasquel y Henríquez. Departamento de Sistemas Computacionales y Electrónica. Zapopan, Jalisco, México

DOI:

https://doi.org/10.30973/progmat/2026.18.3/1

Palabras clave:

Reconocimiento de comandos de voz, extracción de características, refuerzo de gradiente

Resumen

En el método tradicional de reconocimiento automático de voz, las señales de voz se traducen a texto para identificar palabras. Sin embargo, en algunos casos, como la robótica colaborativa, se requiere un reconocimiento rápido de comandos de voz, evitando la transformación de fonemas en texto. La extracción de características de las señales de voz es un paso crítico de preprocesamiento antes del entrenamiento de un modelo de aprendizaje automático. En este artículo se describe el método de extracción de características MFCC, CHROMA, TZ en el dominio de la frecuencia y RMS, ZC, TEMPO en el dominio del tiempo. Se creó un conjunto de datos de 600 grabaciones de audio. Para cada uno de los 10 comandos en español se hicieron 30 grabaciones de 20 hablantes adultos. En el análisis de la importancia de las características, concluimos que las características CHROMA no proporcionan datos informativos que mejoren la tarea de clasificación de señales de voz.  Los resultados muestran que el reconocimiento de comandos de voz mediante un modelo de refuerzo de gradiente basado en histogramas HGB logra predicciones correctas en un 80% de los casos de prueba en 21.77 ms. Este modelo se comparó contra otros modelos de aprendizaje automático, logrando una mejor métrica de exactitud.

Biografía del autor/a

Teth Azrael Cortes Aguilar, Tecnológico Nacional de México. Instituto Tecnológico José Mario Molina Pasquel y Henríquez. Departamento de Sistemas Computacionales y Electrónica. Zapopan, Jalisco, México

Teth Azrael Cortes-Aguilar (Dr.) Recibió el grado de ingeniero en comunicaciones y electrónica por la Universidad de Guadalajara en 2003. Obtuvo el grado de maestro en ciencias en óptica por el centro de investigación CICESE, Ensenada, México en 2005. En 2022 recibió el grado de doctor en manufactura avanzada por el centro de tecnología avanzada CIATEQ. Actualmente se desempeña como profesor investigador en el departamento de ingeniería electrónica, con perfil PRODEP del Tecnológico Nacional de México en la unidad académica Zapopan del Instituto Tecnológico José Mario Molina Pasquel y Henríquez, Jalisco. Desde 2024 es candidato en el SNII de la Secretaría de Ciencia, Humanidades, Tecnología e Innovación (SECIHTI) del gobierno del México.

Adriana Tovar Arriaga, Tecnológico Nacional de México. Instituto Tecnológico José Mario Molina Pasquel y Henríquez. Departamento de Sistemas Computacionales y Electrónica. Zapopan, Jalisco, México

Adriana Tovar-Arriaga (MSC.) Recibió en grado de ingeniera en sistemas computacionales por el Instituto Tecnológico de Querétaro, México, en 1999, y el grado de maestría en sistemas computacionales por el Instituto Tecnológico de Zapopan en 2016. Desde 2007 es profesora de la carrera de ingeniería en sistemas computacionales con perfil PRODEP del Tecnológico Nacional de México en la unidad académica Zapopan del Instituto Tecnológico José Mario Molina Pasquel y Henríquez, Jalisco, México. También es profesora en el departamento de sistemas computaciones en la universidad ITESO, Tlaquepaque, Jalisco, México.

Citas

Ayache M, Kanaan H, Kassir K, Kassir Y. Speech command recognition using deep learning. En: Sixth Int. Conf. on Advances in Biomedical Engineering (ICABME); 2021; Werdanyeh, Lebanon. p. 24-29. doi: https://doi.org/10.1109/ICABME53305.2021.9604862

Pedregosa F, et al. Scikit-learn: machine learning in Python. Journal of Machine Learning Research (2011) 12(85):2825-2830. https://scikit-learn.org/stable/

Schapire RE. Explaining AdaBoost. En: Empirical Inference: Festschrift in Honor of Vladimir N. Vapnik. Springer Berlin Heidelberg (2013) p. 37-52. doi: https://doi.org/10.1007/978-3-642-41136-6_5

Chen T, Guestrin C. XGBoost: a scalable tree boosting system. En: Proc. of the 22nd ACM SIGKDD Int. Conf. on Knowledge Discovery and Data Mining (KDD '16); 2016; New York, NY, USA. Association for Computing Machinery. p. 785-794. doi: https://doi.org/10.1145/2939672.2939785

Ke G, et al. LightGBM: A highly efficient gradient boosting decision tree. En: Proc. of the 31st Conf. on Neural Information Processing Systems (NIPS 2017); 2017 Dec 4-9; Long Beach, USA. p. 3149-3157.

Chugani V. ¿Qué es el refuerzo? Tutoriales de Ciencia de Datos. DataCamp. 11 Agosto 2024. [citado 4 de Marzo de 2024]. https://www.datacamp.com/es/tutorial/what-is-boosting

Verma GK, Soni B, Bourennane S, Ramos ACB. Data science: theory, algorithms, and applications. Transactions on Computer Systems and Networks. Springer (2021). doi: https://doi.org/10.1007/978-981-16-1681-5

Rufo DD, Debelee TG, Ibenthal A, Negera WG. Diagnosis of diabetes mellitus using gradient boosting machine (LightGBM). Diagnostics (2021) 11(19): 1714. doi: https://doi.org/10.3390/diagnostics11091714

Liao H, Zhang X, Zhao C, Chen Y, Zeng X, Li H. LightGBM: an efficient and accurate method for predicting pregnancy diseases. Journal of Obstetrics and Gynaecology (2021) 42(4):620-629. doi: https://doi.org/10.1080/01443615.2021.1945006.

Anitha C. Real-time social media sentiment analysis: a comparative study of LightGBM and SVM. En: 2025 Int. Conf. on Electronics and Renewable Systems (ICEARS); 2025; Tuticorin, India. p. 1947-1950. doi: https://doi.org/10.1109/ICEARS64219.2025.10940651

Monteiro P, Lino J, Esteves Araújo R, Costa L. Comparison between LightGBM and other ML algorithms in PV fault classification. EAI Endorsed Transactions on the Energy Web (2024) 11(1):1-7. doi: https://doi.org/10.4108/ew.4865.

Essa E, Omar K, Alqahtani A. Fake news detection based on a hybrid BERT and LightGBM models. Complex & Intelligent Systems (2023) 9:6581-6592. doi: https://doi.org/10.1007/s40747-023-01098-0

Guo M, Guo Y, Peng Y, Zhang W, Ling Q. Fault diagnosis of bolt loosening based on LightGBM recognition of sound signal features. IEEE Sensors Journal (2023) 23(19):22777-22787. doi: https://doi.org/10.1109/JSEN.2023.3303223

Kannapiran P, Sindha MMR. Voice-based gender recognition model using FRT and LightGBM. Tehnički vjesnik (2023) 30(1):282-291. doi: https://doi.org/10.17559/TV-20220302182704

Xiwen Y, Xiaosong Z. Speaker recognition system with limited data based on LightGBM and fusion features. En: 6th Int. Conf. on Computational Intelligence and Applications (ICCIA); 2021; Xiamen, China. p. 160-164. doi: https://doi.org/10.1109/ICCIA52886.2021.00038

Ong KL, Lee CP, Lim HS, Lim KM. Speech emotion recognition with light gradient boosting decision trees machine. International Journal of Electrical and Computer Engineering (IJECE) (2023) 13(4):4020-4028. doi: https://doi.org/10.11591/ijece.v13i4.pp4020-4028

Yu J, Qu Y, Zhang Z, Lu Q, Qin Z, Liu X. Speech recognition based on concatenated acoustic feature and LightGBM model. En: Twelfth Int. Conf. on Signal Processing Systems. Proc. SPIE (2021) 11719:181-188. doi: https://doi.org/10.1117/12.2581426

Sun X, Fu J, Wei B, Li Z, Li Y, Wang N. A self-attentional ResNet-LightGBM model for IoT-enabled voice liveness detection. IEEE Internet of Things Journal (2023) 10(9):8257-8270. doi: https://doi.org/10.1109/JIOT.2022.3230992

Guryanov A. Histogram-based algorithm for building gradient boosting ensembles of piecewise linear decision trees. En: van der Aalst W, et al, editores. Analysis of Images, Social Networks and Texts. AIST 2019. LNCS. Springer, Cham (2019) 11832:39-50. doi: https://doi.org/10.1007/978-3-030-37334-4_4.

McFee B, Raffel C, Liang D, Ellis DP, McVicar M, Battenberg E, et al. Librosa: audio and music signal analysis in Python. En: Proc. of the 14th Python in Science Conference; 2015; Austin, TX, USA. p. 18-25. doi: https://doi.org/10.25080/Majora-7b98e3ed-003.

de Paz GGE, Quintero Flores, Quiñones Solís X. Lenguaje de programación para la composición automática de música. Programación Matemática Y Software (2025) 17(1):1-10. doi: https://doi.org/10.30973/progmat/2025.17.1/1

Shagi GU, Aji SA. A machine learning approach for gender identification using statistical features of pitch in speeches. Applied Acoustics (2022) 185:108392. doi: https://doi.org/10.1016/j.apacoust.2021.108392

Kone VS, Anagal A, Anegundi S, Jadhav P, Kulkarni U, MSM. Voice-based gender and age recognition system. En: Int. Conf. on Advancement in Computation & Computer Technologies (InCACCT); 2023; Gharuan, India. p. 74-80. doi: https://doi.org/10.1109/InCACCT57535.2023.10141801.

Cortes Aguilar TA, Tovar Arriaga A. Spanish voice command recognition. Figshare. Dataset (2025). doi: https://doi.org/10.6084/m9.figshare.30790625

Fallon J, Pylkkänen L. Language at a glance: how our brains grasp linguistic structure from parallel visual input. Science Advances (2024) 10(43):1-9. doi: https://doi.org/10.1126/sciadv.adr9951

Malik M, Malik MK, Mehmood K, Makhdoom I. Automatic speech recognition: a survey. Multimedia Tools and Applications (2021) 80:9411-9457. doi: https://doi.org/10.1007/s11042-020-10073-7

Batuwita R, Palade V. FSVM-CIL: fuzzy support vector machines for class imbalance learning. IEEE Transactions on Fuzzy Systems (2010) 18(3):558-571. doi: https://doi.org/10.1109/TFUZZ.2010.2042721

Dumitru CO, Gavat I. A comparative study of feature extraction methods applied to continuous speech recognition in Romanian language. En: Proceedings ELMAR; 2006; Zadar, Croatia. p. 115-118. doi: https://doi.org/10.1109/ELMAR.2006.329528

Trentin E, Gori M. A survey of hybrid ANN/HMM models for automatic speech recognition. Neurocomputing (2001) 37(1-4):91-126. doi: https://doi.org/10.1016/S0925-2312(00)00308-8

Descargas

Publicado

02-10-2026

Cómo citar

Cortes Aguilar, T. A., & Tovar Arriaga, A. . (2026). Reconocimiento de comandos de voz mediante refuerzo de gradiente basado en histograma . Programación matemática Y Software, 18(3), 1–15. https://doi.org/10.30973/progmat/2026.18.3/1

Número

Sección

Artículos