Reconocimiento de comandos de voz mediante refuerzo de gradiente basado en histograma
DOI:
https://doi.org/10.30973/progmat/2026.18.3/1Palabras clave:
Reconocimiento de comandos de voz, extracción de características, refuerzo de gradienteResumen
En el método tradicional de reconocimiento automático de voz, las señales de voz se traducen a texto para identificar palabras. Sin embargo, en algunos casos, como la robótica colaborativa, se requiere un reconocimiento rápido de comandos de voz, evitando la transformación de fonemas en texto. La extracción de características de las señales de voz es un paso crítico de preprocesamiento antes del entrenamiento de un modelo de aprendizaje automático. En este artículo se describe el método de extracción de características MFCC, CHROMA, TZ en el dominio de la frecuencia y RMS, ZC, TEMPO en el dominio del tiempo. Se creó un conjunto de datos de 600 grabaciones de audio. Para cada uno de los 10 comandos en español se hicieron 30 grabaciones de 20 hablantes adultos. En el análisis de la importancia de las características, concluimos que las características CHROMA no proporcionan datos informativos que mejoren la tarea de clasificación de señales de voz. Los resultados muestran que el reconocimiento de comandos de voz mediante un modelo de refuerzo de gradiente basado en histogramas HGB logra predicciones correctas en un 80% de los casos de prueba en 21.77 ms. Este modelo se comparó contra otros modelos de aprendizaje automático, logrando una mejor métrica de exactitud.
Citas
Ayache M, Kanaan H, Kassir K, Kassir Y. Speech command recognition using deep learning. En: Sixth Int. Conf. on Advances in Biomedical Engineering (ICABME); 2021; Werdanyeh, Lebanon. p. 24-29. doi: https://doi.org/10.1109/ICABME53305.2021.9604862
Pedregosa F, et al. Scikit-learn: machine learning in Python. Journal of Machine Learning Research (2011) 12(85):2825-2830. https://scikit-learn.org/stable/
Schapire RE. Explaining AdaBoost. En: Empirical Inference: Festschrift in Honor of Vladimir N. Vapnik. Springer Berlin Heidelberg (2013) p. 37-52. doi: https://doi.org/10.1007/978-3-642-41136-6_5
Chen T, Guestrin C. XGBoost: a scalable tree boosting system. En: Proc. of the 22nd ACM SIGKDD Int. Conf. on Knowledge Discovery and Data Mining (KDD '16); 2016; New York, NY, USA. Association for Computing Machinery. p. 785-794. doi: https://doi.org/10.1145/2939672.2939785
Ke G, et al. LightGBM: A highly efficient gradient boosting decision tree. En: Proc. of the 31st Conf. on Neural Information Processing Systems (NIPS 2017); 2017 Dec 4-9; Long Beach, USA. p. 3149-3157.
Chugani V. ¿Qué es el refuerzo? Tutoriales de Ciencia de Datos. DataCamp. 11 Agosto 2024. [citado 4 de Marzo de 2024]. https://www.datacamp.com/es/tutorial/what-is-boosting
Verma GK, Soni B, Bourennane S, Ramos ACB. Data science: theory, algorithms, and applications. Transactions on Computer Systems and Networks. Springer (2021). doi: https://doi.org/10.1007/978-981-16-1681-5
Rufo DD, Debelee TG, Ibenthal A, Negera WG. Diagnosis of diabetes mellitus using gradient boosting machine (LightGBM). Diagnostics (2021) 11(19): 1714. doi: https://doi.org/10.3390/diagnostics11091714
Liao H, Zhang X, Zhao C, Chen Y, Zeng X, Li H. LightGBM: an efficient and accurate method for predicting pregnancy diseases. Journal of Obstetrics and Gynaecology (2021) 42(4):620-629. doi: https://doi.org/10.1080/01443615.2021.1945006.
Anitha C. Real-time social media sentiment analysis: a comparative study of LightGBM and SVM. En: 2025 Int. Conf. on Electronics and Renewable Systems (ICEARS); 2025; Tuticorin, India. p. 1947-1950. doi: https://doi.org/10.1109/ICEARS64219.2025.10940651
Monteiro P, Lino J, Esteves Araújo R, Costa L. Comparison between LightGBM and other ML algorithms in PV fault classification. EAI Endorsed Transactions on the Energy Web (2024) 11(1):1-7. doi: https://doi.org/10.4108/ew.4865.
Essa E, Omar K, Alqahtani A. Fake news detection based on a hybrid BERT and LightGBM models. Complex & Intelligent Systems (2023) 9:6581-6592. doi: https://doi.org/10.1007/s40747-023-01098-0
Guo M, Guo Y, Peng Y, Zhang W, Ling Q. Fault diagnosis of bolt loosening based on LightGBM recognition of sound signal features. IEEE Sensors Journal (2023) 23(19):22777-22787. doi: https://doi.org/10.1109/JSEN.2023.3303223
Kannapiran P, Sindha MMR. Voice-based gender recognition model using FRT and LightGBM. Tehnički vjesnik (2023) 30(1):282-291. doi: https://doi.org/10.17559/TV-20220302182704
Xiwen Y, Xiaosong Z. Speaker recognition system with limited data based on LightGBM and fusion features. En: 6th Int. Conf. on Computational Intelligence and Applications (ICCIA); 2021; Xiamen, China. p. 160-164. doi: https://doi.org/10.1109/ICCIA52886.2021.00038
Ong KL, Lee CP, Lim HS, Lim KM. Speech emotion recognition with light gradient boosting decision trees machine. International Journal of Electrical and Computer Engineering (IJECE) (2023) 13(4):4020-4028. doi: https://doi.org/10.11591/ijece.v13i4.pp4020-4028
Yu J, Qu Y, Zhang Z, Lu Q, Qin Z, Liu X. Speech recognition based on concatenated acoustic feature and LightGBM model. En: Twelfth Int. Conf. on Signal Processing Systems. Proc. SPIE (2021) 11719:181-188. doi: https://doi.org/10.1117/12.2581426
Sun X, Fu J, Wei B, Li Z, Li Y, Wang N. A self-attentional ResNet-LightGBM model for IoT-enabled voice liveness detection. IEEE Internet of Things Journal (2023) 10(9):8257-8270. doi: https://doi.org/10.1109/JIOT.2022.3230992
Guryanov A. Histogram-based algorithm for building gradient boosting ensembles of piecewise linear decision trees. En: van der Aalst W, et al, editores. Analysis of Images, Social Networks and Texts. AIST 2019. LNCS. Springer, Cham (2019) 11832:39-50. doi: https://doi.org/10.1007/978-3-030-37334-4_4.
McFee B, Raffel C, Liang D, Ellis DP, McVicar M, Battenberg E, et al. Librosa: audio and music signal analysis in Python. En: Proc. of the 14th Python in Science Conference; 2015; Austin, TX, USA. p. 18-25. doi: https://doi.org/10.25080/Majora-7b98e3ed-003.
de Paz GGE, Quintero Flores, Quiñones Solís X. Lenguaje de programación para la composición automática de música. Programación Matemática Y Software (2025) 17(1):1-10. doi: https://doi.org/10.30973/progmat/2025.17.1/1
Shagi GU, Aji SA. A machine learning approach for gender identification using statistical features of pitch in speeches. Applied Acoustics (2022) 185:108392. doi: https://doi.org/10.1016/j.apacoust.2021.108392
Kone VS, Anagal A, Anegundi S, Jadhav P, Kulkarni U, MSM. Voice-based gender and age recognition system. En: Int. Conf. on Advancement in Computation & Computer Technologies (InCACCT); 2023; Gharuan, India. p. 74-80. doi: https://doi.org/10.1109/InCACCT57535.2023.10141801.
Cortes Aguilar TA, Tovar Arriaga A. Spanish voice command recognition. Figshare. Dataset (2025). doi: https://doi.org/10.6084/m9.figshare.30790625
Fallon J, Pylkkänen L. Language at a glance: how our brains grasp linguistic structure from parallel visual input. Science Advances (2024) 10(43):1-9. doi: https://doi.org/10.1126/sciadv.adr9951
Malik M, Malik MK, Mehmood K, Makhdoom I. Automatic speech recognition: a survey. Multimedia Tools and Applications (2021) 80:9411-9457. doi: https://doi.org/10.1007/s11042-020-10073-7
Batuwita R, Palade V. FSVM-CIL: fuzzy support vector machines for class imbalance learning. IEEE Transactions on Fuzzy Systems (2010) 18(3):558-571. doi: https://doi.org/10.1109/TFUZZ.2010.2042721
Dumitru CO, Gavat I. A comparative study of feature extraction methods applied to continuous speech recognition in Romanian language. En: Proceedings ELMAR; 2006; Zadar, Croatia. p. 115-118. doi: https://doi.org/10.1109/ELMAR.2006.329528
Trentin E, Gori M. A survey of hybrid ANN/HMM models for automatic speech recognition. Neurocomputing (2001) 37(1-4):91-126. doi: https://doi.org/10.1016/S0925-2312(00)00308-8
Publicado
Cómo citar
Número
Sección
Licencia
Derechos de autor 2026 Teth Azrael Cortes Aguilar, Adriana Tovar Arriaga

Esta obra está bajo una licencia internacional Creative Commons Atribución 4.0.
Usted es libre de:
![]() |
Compartir — compartir y redistribuir el material publicado en cualquier medio o formato. |
![]() |
Adaptar — combinar, transformar y construir sobre el material para cualquier propósito, incluso comercialmente. |
Bajo las siguientes condiciones:
![]() |
Atribución — Debe otorgar el crédito correspondiente, proporcionar un enlace a la licencia e indicar si se realizaron cambios. Puede hacerlo de cualquier manera razonable, pero de ninguna manera que sugiera que el licenciador lo respalda a usted o a su uso. |
| Sin restricciones adicionales: no puede aplicar términos legales o medidas tecnológicas que restrinjan legalmente a otros a hacer cualquier cosa que permita la licencia. |








