{"id":12629,"date":"2025-03-12T23:05:49","date_gmt":"2025-03-12T23:05:49","guid":{"rendered":"https:\/\/lacunafund.org\/?p=12629"},"modified":"2025-03-12T23:05:49","modified_gmt":"2025-03-12T23:05:49","slug":"lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma","status":"publish","type":"post","link":"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/","title":{"rendered":"Lacuna Fund publica 18 nuevos conjuntos de datos de inteligencia artificial (IA) que ayudan a las comunidades locales a abordar los desaf\u00edos de la agricultura, el clima, la salud y el idioma"},"content":{"rendered":"<h2><img loading=\"lazy\" decoding=\"async\" class=\"alignnone wp-image-12606 aligncenter\" src=\"https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-300x169.png\" alt=\"\" width=\"850\" height=\"479\" srcset=\"https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-300x169.png 300w, https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-1024x576.png 1024w, https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-768x432.png 768w, https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-1536x864.png 1536w, https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-1280x720.png 1280w, https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-640x360.png 640w, https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-810x456.png 810w, https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-160x90.png 160w, https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2.png 1600w\" sizes=\"auto, (max-width: 850px) 100vw, 850px\" \/><\/h2>\n<h2><span style=\"color: #2cb34a;\">Publicaci\u00f3n de 18\u00a0nuevos conjuntos de datos de IA en los \u00e1mbitos de la agricultura, el clima, la salud y el idioma<\/span><\/h2>\n<p>Hoy nos complace anunciar la reciente publicaci\u00f3n de dieciocho conjuntos de datos para entrenar la inteligencia artificial (IA) en los \u00e1mbitos de la <a href=\"https:\/\/lacunafund.org\/es\/agricultura\/\">agricultura<\/a>, el <a href=\"https:\/\/lacunafund.org\/es\/5454-2\/\">clima<\/a>, la <a href=\"https:\/\/lacunafund.org\/es\/salud\/\">salud<\/a> y el <a href=\"https:\/\/lacunafund.org\/es\/idioma\/\">procesamiento del lenguaje natural (NLP)<\/a><a href=\"https:\/\/lacunafund.org\/es\/idioma\/\">.<\/a> Estos conjuntos de datos aprovechan el poder de la IA para abordar problemas sociales y econ\u00f3micos urgentes en \u00c1frica y Am\u00e9rica Latina, as\u00ed como en comunidades con bajos ingresos en los Estados Unidos.<\/p>\n<p>A continuaci\u00f3n, encontrar\u00e1 m\u00e1s informaci\u00f3n sobre estos conjuntos de datos y c\u00f3mo acceder a ellos.<\/p>\n<p><em>Lacuna Fund es una <\/em><a href=\"https:\/\/lacunafund.org\/governance\/\"><em>coalici\u00f3n de financiadores, cient\u00edficos de datos y usuarios de datos<\/em><\/a><em> con un compromiso en pos de cubrir las carencias de datos y hacer que el aprendizaje autom\u00e1tico y la IA sean m\u00e1s equitativos, precisos y accesibles en todo el mundo. <\/em><\/p>\n<p><em>Agradecemos enormemente a <\/em><a href=\"https:\/\/lacunafund.org\/es\/patrocinadores\/\"><em>nuestros financiadores<\/em><\/a><em>, entre ellos <\/em><a href=\"https:\/\/www.rockefellerfoundation.org\/\"><em>The Rockefeller Foundation<\/em><\/a><em>, <\/em><a href=\"http:\/\/google.org\/\"><em>Google.org<\/em><\/a><em>, el <\/em><a href=\"https:\/\/www.idrc.ca\/es\"><em>Centro Internacional de Investigaciones para el Desarrollo de Canad\u00e1<\/em><\/a><em>, el Ministerio Federal de Cooperaci\u00f3n Econ\u00f3mica y Desarrollo (BMZ) de Alemania y su iniciativa <\/em><a href=\"https:\/\/www.bmz-digital.global\/en\/overview-of-initiatives\/fair-forward\/\"><em>FAIR Forward<\/em><\/a><em>, <\/em><a href=\"https:\/\/wellcome.org\/what-we-do\/our-work\/data-science-and-health-trustworthy-data-science\"><em>Wellcome<\/em><\/a><em>, <\/em><a href=\"http:\/\/www.moore.org\/\"><em>Gordon and Betty Moore Foundation<\/em><\/a><em>, <\/em><a href=\"https:\/\/www.mcgovern.org\/\"><em>Patrick J. McGovern Foundation<\/em><\/a><em> y <\/em><a href=\"http:\/\/www.rwjf.org\/\"><em>Robert Wood Johnson Foundation<\/em><\/a><em>, que hacen posible la creaci\u00f3n de estos conjuntos de datos.<\/em><\/p>\n<img loading=\"lazy\" decoding=\"async\" class=\"wp-image-12599 aligncenter\" src=\"https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/Lacuna-Fund-Funders-Collage-2025-300x188.png\" alt=\"\" width=\"705\" height=\"442\" srcset=\"https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/Lacuna-Fund-Funders-Collage-2025-300x188.png 300w, https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/Lacuna-Fund-Funders-Collage-2025-768x480.png 768w, https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/Lacuna-Fund-Funders-Collage-2025-640x400.png 640w, https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/Lacuna-Fund-Funders-Collage-2025-160x100.png 160w, https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/Lacuna-Fund-Funders-Collage-2025.png 960w\" sizes=\"auto, (max-width: 705px) 100vw, 705px\" \/>\n<h2><span style=\"color: #2cb34a;\"><strong>Agricultura<\/strong><\/span><\/h2>\n<p><em>Los conjuntos de datos sobre agricultura de Lacuna\u00a0Fund ponen a disposici\u00f3n el poder del aprendizaje autom\u00e1tico para enfrentar los desaf\u00edos de la seguridad alimentaria, estimular las oportunidades econ\u00f3micas y brindar a los investigadores, los agricultores, las comunidades y los legisladores acceso a conjuntos de datos agr\u00edcolas superiores.<\/em><\/p>\n<h3><strong>CropHarvest: informar la toma de decisiones sobre desarrollo agr\u00edcola, sistemas de alerta temprana y comercio en \u00c1frica subsahariana <\/strong><\/h3>\n<p><strong>Pa\u00edses: <\/strong>Kenia, Mali, Togo, Ruanda, Uganda, Etiop\u00eda, Malaui, Zambia, Tanzania, Namibia, Sud\u00e1n y Nigeria<\/p>\n<p><strong>Contacto: Catherine Nakalembe | <\/strong><a href=\"mailto:cnakalem@umd.edu\">cnakalem@umd.edu<\/a><\/p>\n<p>CropHarvest aumenta la comprensi\u00f3n de los principales tipos de producci\u00f3n de alimentos en \u00c1frica subsahariana y puede ayudar a fundamentar la toma de decisiones en torno al desarrollo agr\u00edcola, los sistemas de alerta temprana y el comercio regional. Se trata de un conjunto de datos de detecci\u00f3n remota global y de c\u00f3digo abierto para la clasificaci\u00f3n de cultivos en \u00c1frica subsahariana, concretamente en Kenia, Mali, Togo, Ruanda, Uganda, Etiop\u00eda, Malawi, Zambia, Tanzania, Namibia, Sud\u00e1n y Nigeria.<\/p>\n<p>El equipo ampli\u00f3 un conjunto de datos existente publicado en 2021 para incluir ahora lo siguiente: nuevos puntos de datos etiquetados mediante Collect Earth Online, datos sobre el terreno para el mapeo de los tipos de cultivos, im\u00e1genes a nivel de la calle, im\u00e1genes etiquetadas de fuentes populares y datos sobre precios. Adem\u00e1s, los datos de Collect Earth Online se muestrearon aleatoriamente para cubrir todo el pa\u00eds, lo que permiti\u00f3 cerrar brechas de datos fundamentales sobre patrones de cultivo y rendimientos.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>NASA Harvest:<\/strong> Tseng, G.<\/span><\/li>\n<li><span><strong>Universidad de Maryland, College Park:<\/strong> Zvonkov, I., Nakalembe, C.L. y Kerner, H.<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos: <\/strong><a href=\"https:\/\/zenodo.org\/record\/7257688#.ZFATwuzMI0Q;\">https:\/\/github.com\/nasaharvest\/cropharvest<\/a><\/p>\n<hr \/>\n<h3><strong>M<\/strong><strong>ejorar los medios de subsistencia en Ghana y Uganda: conjunto de datos agr\u00edcolas basados en drones para el c\u00e1lculo del rendimiento de los cultivos de anacardo, cacao y caf\u00e9<\/strong><\/h3>\n<p><strong>Pa\u00edses:<\/strong> Ghana, Uganda<\/p>\n<p><strong>Contacto: Darlington Akogo |<\/strong> darlington@gudra-studio.com<\/p>\n<p>Este conjunto de datos permite calcular el rendimiento, detectar y clasificar el tipo de cultivo, detectar y contar la fruta, y detectar el estado de madurez de la fruta (inmadura, madura y estropeada) de tres productos que son importantes fuentes de sustento para millones de hogares de \u00c1frica subsahariana.<\/p>\n<p>Contiene 14.870\u00a0im\u00e1genes de \u00e1rboles de anacardo, cacao y caf\u00e9 tomadas por drones y con anotaciones en cuadros delimitadores en varias granjas de Ghana y Uganda. Los m\u00e9todos convencionales para calcular el rendimiento son costosos, requieren mucho trabajo y tiempo, y son propensos a errores debido a observaciones incompletas del terreno. Esto da lugar a c\u00e1lculos err\u00f3neos del rendimiento de las cosechas y dificulta la capacidad de los agricultores para planificar y gestionar adecuadamente sus campos y canales de producci\u00f3n. Este conjunto de datos ayudar\u00e1 a transformar la agricultura africana en una agroindustria al permitir el desarrollo de soluciones de c\u00e1lculo del rendimiento que permitan a los agricultores tomar buenas decisiones comerciales. Contar con detalles clave sobre la producci\u00f3n agr\u00edcola a los que se pueda acceder f\u00e1cilmente permite cosechar a tiempo, lo que ayuda a los agricultores a garantizar productos saludables y frescos, adem\u00e1s de mejores ventas.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>KaraAgro AI: <\/strong>Darlington Akogo, Cyril Akafia, Harriet Fiagbor, Stephen Torkpo, Christian Kusi<\/span><\/li>\n<li><span><strong>Makerere AI Lab: <\/strong>Joyce Nakatumba-Nabende<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos:<\/strong> <a href=\"https:\/\/huggingface.co\/datasets\/KaraAgroAI\/Drone-based-Agricultural-Dataset-for-Crop-Yield-Estimation\">https:\/\/huggingface.co\/datasets\/KaraAgroAI\/Drone-based-Agricultural-Dataset-for-Crop-Yield-Estimation<\/a><\/p>\n<hr \/>\n<h2><strong>Salud<\/strong><strong>\u00a0\u00a0\u00a0\u00a0 <\/strong><\/h2>\n<p><em>Los conjuntos de datos de salud de Lacuna\u00a0Fund cierran la brecha de las disparidades sanitarias proporcionando conjuntos de datos de aprendizaje autom\u00e1tico precisos y s\u00f3lidos que ayudan a proveedores y pacientes a tomar decisiones que conducen a resultados sanitarios m\u00e1s equitativos. \u00a0<\/em><\/p>\n<h3><span style=\"color: #005a7c;\"><strong>Conjunto de datos de anestesia intraoperatoria y resultados: mejorar los resultados de los pacientes mediante la predicci\u00f3n del riesgo de mortalidad y recuperaci\u00f3n posoperatoria<\/strong><\/span><\/h3>\n<p><strong>Regi\u00f3n: <\/strong>\u00c1frica subsahariana<\/p>\n<p><strong>Contacto: Bhiken Naik | <\/strong><a href=\"mailto:bin4n@uvahealth.org\">bin4n@uvahealth.org<\/a><\/p>\n<p>Este conjunto de datos puede utilizarse para identificar patrones de pr\u00e1ctica de anestesia intraoperatoria y predecir la duraci\u00f3n de la estancia posoperatoria y el riesgo de mortalidad en funci\u00f3n de variables intraoperatorias. Incluye 2.066\u00a0registros de anestesia intraoperatoria de dos centros acad\u00e9micos de \u00c1frica subsahariana. El equipo fotografi\u00f3 registros de anestesia intraoperatoria completos con un tel\u00e9fono inteligente, desidentific\u00f3 las im\u00e1genes y las carg\u00f3 de forma segura en un servidor que cumple con la Ley de Portabilidad y Responsabilidad de Seguros de Salud en Estados Unidos (HIPAA). Mediante una combinaci\u00f3n de IA de visi\u00f3n por computadora y t\u00e9cnicas de extracci\u00f3n manual, el equipo recopil\u00f3 los siguientes datos intraoperatorios integrales: datos demogr\u00e1ficos, datos sobre medicamentos, datos hemodin\u00e1micos, datos fisiol\u00f3gicos, tipo de anestesia, tipo de cirug\u00eda, duraci\u00f3n de la estancia posoperatoria y mortalidad posoperatoria durante 30\u00a0d\u00edas.<\/p>\n<p>Los datos de anestesia intraoperatoria abarcan una amplia variedad de informaci\u00f3n esencial para el cuidado del paciente durante los procedimientos quir\u00fargicos. Sin embargo, la obtenci\u00f3n de este tipo de informaci\u00f3n es especialmente dif\u00edcil en los pa\u00edses de ingresos bajos y medios (LMIC), donde los conjuntos de datos electr\u00f3nicos actuales sobre anestesia intraoperatoria suelen tener un alcance limitado. Como resultado, una cantidad significativa de datos clave, que podr\u00edan ser vitales para la toma de decisiones cl\u00ednicas y la investigaci\u00f3n, est\u00e1n ausentes o no est\u00e1n disponibles. Esta limitaci\u00f3n obstaculiza la capacidad de comprender plenamente y mejorar los resultados de los pacientes en los LMIC, por lo que este conjunto de datos cubre una brecha cr\u00edtica mediante el desarrollo de un m\u00e9todo para incluir todos los elementos de datos de los registros de anestesia intraoperatoria.<\/p>\n<p><strong>Autores y afiliaciones:<\/strong><\/p>\n<ul>\n<li><span><strong>Universidad de Virginia:<\/strong>Bhiken Naik<\/span><\/li>\n<li><span><strong>Facultad de Medicina y Farmacia, Universidad de Ruanda y King Faisal Hospital, Universidad Africana de Ciencias de la Salud:<\/strong>Paulin Banguti<\/span><\/li>\n<li><span><strong>Safe Surgery South Africa:<\/strong>Hyla Kluyts<\/span><\/li>\n<li><span><strong>Universidad de Virginia:<\/strong> Ryan Folks<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos:<\/strong> <a href=\"https:\/\/portal.ithriv.org\/#\/public_commons\/project\/d9fc062c-64c9-4481-80e7-3db4aba17e00\">https:\/\/portal.ithriv.org\/#\/public_commons\/project\/d9fc062c-64c9-4481-80e7-3db4aba17e00<\/a><\/p>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>Conjunto de datos de segmentaci\u00f3n de tumores cerebrales en \u00c1frica (BraTS-Africa)<\/strong><\/span><\/h3>\n<p><strong>Pa\u00eds:<\/strong> Nigeria<\/p>\n<p><strong>Contacto: Udunna Anazodo |<\/strong> <a href=\"mailto:udunna.anazodo@mcgill.ca\">udunna.anazodo@mcgill.ca<\/a><\/p>\n<p>El conjunto de datos de BraTS-Africa es una combinaci\u00f3n de im\u00e1genes por resonancia magn\u00e9tica (MRI) de seis centros en Nigeria que tiene como objetivo proporcionar un conjunto de datos p\u00fablicos para el desarrollo de soluciones de aprendizaje autom\u00e1tico en pos del manejo de tumores cerebrales en pacientes africanos. Este conjunto de datos sirve como marco inicial para una expansi\u00f3n futura en otras regiones de \u00c1frica. El equipo proces\u00f3 y anot\u00f3 un total de 584\u00a0im\u00e1genes de 146\u00a0im\u00e1genes de pacientes. Se presume que 95 de estas im\u00e1genes presentan glioma difuso, y 51 de ellas tienen otros tipos de neoplasias del sistema nervioso central (SNC). Radi\u00f3logos expertos anotaron tres\u00a0subregiones tumorales diferentes para definir las subregiones del tumor en aumento (ET), el n\u00facleo necr\u00f3tico (NCR) y el edema peritumoral\/tejido infiltrado (ED).<\/p>\n<p>Antes de este estudio, no hab\u00eda ning\u00fan conjunto de datos de im\u00e1genes cerebrales anotadas integrales disponible al p\u00fablica de \u00c1frica. El estudio cerr\u00f3 esa brecha para garantizar que las soluciones de aprendizaje autom\u00e1tico para el manejo de las enfermedades neurol\u00f3gicas, como los tumores cerebrales, puedan resolver las necesidades cl\u00ednicas no satisfechas en \u00c1frica subsahariana.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>Medical Artificial Intelligence (MAI) Lab (Lagos, Nigeria): <\/strong>Maruf Adewole, Abiodun Fatade, Oluyemisi Toyobo, Farouk, Dako, Udunna Anazodo<\/span><\/li>\n<li><span><strong>The National Hospital (Abuja, Nigeria):<\/strong> Feyisayo Daji, Chinasa Kalaiwo<\/span><\/li>\n<li><span><strong>Lagos University Teaching Hospital: <\/strong>Olubukola Omidiji<\/span><\/li>\n<li><span><strong>Lagos State University Teaching Hospital:<\/strong> Rachel Akinola<\/span><\/li>\n<li><span><strong>NSIA-Kano Diagnostic Center:<\/strong> Mohammad Abba Suwaid<\/span><\/li>\n<li><span><strong>Federal Medical Centre (Umuahia, Nigeria):<\/strong> Kenneth Aguh<\/span><\/li>\n<li><span><strong>Lily Hospital (Ben\u00edn, Nigeria):<\/strong> Mayomi Onuwaje<\/span><\/li>\n<li><span><strong>Universidad de Pensilvania (Filadelfia, EE.\u00a0UU.)<\/strong>: Farouk Dako<\/span><\/li>\n<li><span><strong>Universidad de Indiana (Indian\u00e1polis, EE.\u00a0UU.)<\/strong>: Spyridon Bakas<\/span><\/li>\n<li><span><strong>Scripps Clinic Medical Group (San Diego, EE.\u00a0UU.)<\/strong>: Jeffery Rudie<\/span><\/li>\n<li><span><strong>Universidad McGill (Montreal, Canad\u00e1)<\/strong>: Udunna Anazodo<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos: <\/strong><a href=\"https:\/\/www.cancerimagingarchive.net\">https:\/\/www.cancerimagingarchive.net<\/a><\/p>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>Microscop\u00eda de tel\u00e9fonos inteligentes asistida por IA para la detecci\u00f3n de par\u00e1sitos que causan diarrea<\/strong><\/span><\/h3>\n<p><strong>Pa\u00eds: <\/strong>Nepal<\/p>\n<p><strong>Contacto: <\/strong><strong>Bishesh Khanal | <\/strong><a href=\"mailto:bishesh.khanal@naamii.org.np\">bishesh.khanal@naamii.org.np<\/a><\/p>\n<p>Este conjunto de datos ayuda a detectar par\u00e1sitos que causan diarrea en zonas rurales con recursos limitados, sobre todo en el sur global, donde el acceso a herramientas de diagn\u00f3stico costosas es limitado. Contiene aproximadamente 400.000\u00a0im\u00e1genes de diapositivas microsc\u00f3picas de muestras de agua, vegetales y heces de cuatro provincias diferentes de Nepal, lo que lo convierte en uno de los conjuntos de datos m\u00e1s grandes de su tipo. El equipo recolect\u00f3 muestras de agua de diferentes fuentes (es decir, agua del grifo, agua embotellada, lago, r\u00edo, estanque, arroyo, agua de manantial, humedal, agua de pozo y de pozo perforado) y utiliz\u00f3 siete tipos diferentes de vegetales. Mediante el uso del conjunto de datos y las anotaciones disponibles, el equipo entren\u00f3 diferentes modelos de aprendizaje profundo para detectar par\u00e1sitos de forma autom\u00e1tica, espec\u00edficamente quistes de Giardia y Cryptosporidium.<\/p>\n<p>Las im\u00e1genes de las muestras se capturaron con tel\u00e9fonos inteligentes y microscopios de campo claro antes de cargarse en una plataforma en l\u00ednea de recopilaci\u00f3n y anotaci\u00f3n de datos. Esta plataforma permite a varios usuarios cargar im\u00e1genes de muestras con funciones basadas en permisos para el control de calidad. Los usuarios autorizados pueden revisar las im\u00e1genes cargadas, aprobarlas o rechazarlas, a\u00f1adir comentarios sobre im\u00e1genes individuales y filtrar la vista de muestras en funci\u00f3n de un determinado intervalo de fechas o provincia. Como primer paso, este conjunto de datos se centr\u00f3 en Nepal, pero est\u00e1 dise\u00f1ado para aplicarse en regiones similares de todo el mundo.<\/p>\n<p><strong>Autores y afiliaciones:<\/strong><\/p>\n<ul>\n<li><span><strong>Instituto de Investigaci\u00f3n en Matem\u00e1ticas Aplicadas e Inform\u00e1tica de Nepal (NAAMII): <\/strong>Bishesh Khanal, Udit Chandra Aryal, Safal Thapaliya<\/span><\/li>\n<li><span><strong>Instituto de Ciencias Aplicadas de Katmand\u00fa (KIAS): <\/strong>Basant Giri, Dr.\u00a0Susma Giri, Dr.\u00a0Bhanu Neupane, Asmita Adhikari, Asmita Karki, Ramdeep Shrestha, Aayusha Upreti, Pramikshya Bagale, Deepa Prajapati, Prashamsa Shrestha, Celeus Baral<\/span><\/li>\n<li><span><strong>Nyaya Health Nepal, Bayalpata: <\/strong>Mandeep Pathak, Ekendra Kunwar, Khadak Chaudhary, Sunil Buda, Tapendra Kunwar, Ramesh Badahit, Nim Prakash Sharma<\/span><\/li>\n<li><span><strong>Provincial Public Health Laboratory (PPHL), Janakpur: <\/strong>Shravan Kumar Mishra, Santosh Kumar Yadav, Jitendra Kumar Sah, Amrendra Kumar Mishra, Sarwajit Yadav, Ashish Jha<\/span><\/li>\n<li><span><strong>Instituto de Salud Infantil de Katmand\u00fa (KIOCH), Damak: <\/strong> Dr.\u00a0Bhagawan Koirala, Dr.\u00a0Sandeepa Karki, Dr.\u00a0Jayamani Shrestha<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos: <\/strong><a href=\"https:\/\/zenodo.org\/records\/13913469\">https:\/\/zenodo.org\/records\/13913469<\/a><\/p>\n<h4><\/h4>\n<h4><span style=\"color: #2cb34a;\"><strong>Para ver todos los conjuntos de datos de salud de Lacuna Fund, visite: <\/strong><\/span><a href=\"https:\/\/lacunafund.org\/datasets\/health\/\"><strong>https:\/\/lacunafund.org\/datasets\/health\/<\/strong><\/a><\/h4>\n<hr \/>\n<h2><span style=\"color: #2cb34a;\"><strong>Clima<\/strong><strong>\u00a0\u00a0\u00a0\u00a0 <\/strong><\/span><\/h2>\n<p><em>Desde la comprensi\u00f3n de los efectos del cambio clim\u00e1tico en los resultados de salud hasta el fortalecimiento de la planificaci\u00f3n de la electrificaci\u00f3n, los conjuntos de datos clim\u00e1ticos de Lacuna Fund permiten a las comunidades de todo el mundo mitigar mejor el cambio clim\u00e1tico y adaptarse a \u00e9l.<\/em><\/p>\n<h3><span style=\"color: #005a7c;\"><strong>Proyecto Cambio clim\u00e1tico, salud e inteligencia artificial (CCHAIN): datos de salud p\u00fablica para Filipinas<\/strong><\/span><\/h3>\n<p><strong>Pa\u00eds: <\/strong>Filipinas<\/p>\n<p><strong>Contacto: Thinking Machines Data Science | <\/strong>data-for-development@thinkingmachin.es<\/p>\n<p>El conjunto de datos del Proyecto CCHAIN es un conjunto de datos abierto, vinculado y listo para el an\u00e1lisis de variables sanitarias, clim\u00e1ticas, medioambientales y socioecon\u00f3micas validadas recopiladas a nivel de aldea (\u201cbarangay\u201d) en 12\u00a0ciudades filipinas durante 20\u00a0a\u00f1os (2003-2022). Este conjunto de datos incluye observaciones de unas 17\u00a0enfermedades recopiladas mediante visitas de campo al Departamento de Salud de Filipinas (DOH) y a la Autoridad Estad\u00edstica de Filipinas (PSA). Otro componente de este conjunto de datos es \u201cOpen Buildings\u201d, que tambi\u00e9n funciona como un conjunto de datos independiente que el equipo cre\u00f3 y que contiene 12.000\u00a0contornos de edificios que muestran densidades de vecindarios, terrenos y niveles de urbanizaci\u00f3n, as\u00ed como zonas a\u00fan no cartografiadas en OpenStreetMap. Cada contorno se traz\u00f3 mediante una combinaci\u00f3n de inspecci\u00f3n visual de im\u00e1genes satelitales, conocimiento local y validaci\u00f3n a partir de datos de encuestas de hogares para abarcar todos los edificios presentes en la zona.<\/p>\n<p>En Filipinas, los investigadores y otros usuarios finales que necesiten datos de salud p\u00fablica de centros rurales de atenci\u00f3n m\u00e9dica, incluidos programas de nivel nacional, pueden solicitar esta informaci\u00f3n del Departamento de Salud de Filipinas (DOH), donde un comit\u00e9 de revisi\u00f3n toma las decisiones de aprobaci\u00f3n finales. Sin embargo, este proceso a\u00fan no se ajusta a la definici\u00f3n de datos verdaderamente abiertos, que deben facilitarse al p\u00fablico de forma proactiva para fomentar la transparencia, la innovaci\u00f3n y la colaboraci\u00f3n sin necesidad de solicitudes o permisos.<\/p>\n<p>Los problemas de privacidad y seguridad siguen siendo obst\u00e1culos de importancia para el acceso a los datos, ya que los organismos intentan equilibrar los beneficios p\u00fablicos con los riesgos de confidencialidad. Otro obst\u00e1culo para la accesibilidad y disponibilidad es la escasez de datos digitalizados a nivel comunitario debido a la falta de capacitaci\u00f3n del personal y a las limitaciones presupuestarias. Al crear el Proyecto CCHAIN, un conjunto de datos abierto y listo para el an\u00e1lisis, aliviamos la carga de los usuarios, que de otro modo tendr\u00edan que gestionar una importante log\u00edstica de datos y conocimientos multidisciplinarios para recopilar y procesar datos de diversas fuentes, formatos y especificaciones geogr\u00e1ficas. Enfocarse en la aldea o \u201cbarangay\u201d, la unidad administrativa m\u00e1s peque\u00f1a en Filipinas, tambi\u00e9n ayuda a clasificar los riesgos de salud para las comunidades vulnerables, particularmente aquellas en asentamientos informales, y brinda informaci\u00f3n viable para los gobiernos locales.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>Thinking Machines Data Science, Inc.:<\/strong> Patricia Anne Faustino, JC Albert Peralta, Veronica Marie Araneta, Dafrose Camille Bajaro, Abigail Moreno<\/span><\/li>\n<li><span><strong>Epimetrics, Inc.:<\/strong>John Q. Wong, Anne Kathlyn Baladad, Luis Antonio Desquitado, Matthew Limlengco, Carlos Miguel Resurreccion<\/span><\/li>\n<li><span><strong>Observatorio de Manila: <\/strong>Faye Abigail Cruz, Dra.\u00a0Julie Mae Dado, Leia Pauline Tonga<\/span><\/li>\n<li><span><strong>Philippine Action for Community-led Shelter Initiatives, Inc.:<\/strong> Ericka Lynne Nava<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos: <\/strong><a href=\"https:\/\/thinkingmachines.github.io\/project-cchain\/\">https:\/\/thinkingmachines.github.io\/project-cchain\/<\/a><\/p>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>Conjunto de datos sobre la calidad del aire en los mataderos del sur de Nigeria<\/strong><\/span><\/h3>\n<p><strong>Pa\u00eds: <\/strong>Nigeria<\/p>\n<p><strong>Contacto: Emmanuel Chukwuma<\/strong> | emmanuel.chukwuma@apse-ngo.org<\/p>\n<p>Este conjunto de datos sobre la calidad del aire es el primero de este tipo en el pa\u00eds procedente de los mataderos. El conjunto de datos localizado es clave en el control y la predicci\u00f3n de la calidad del aire, as\u00ed como en el modelado preciso del \u00edndice de calidad del aire para las se\u00f1ales de alerta temprana y el modelado del riesgo para la salud. Los datos se obtuvieron de mataderos del sur de Nigeria. El equipo recopil\u00f3 datos de muestras representativas de varios estados (Anambra, Enugu, Abia, Imo, Ebonyi y Delta) dentro del \u00e1rea de investigaci\u00f3n. El equipo visit\u00f3 27\u00a0estaciones y realiz\u00f3 investigaciones in situ, recopilando m\u00e1s de 200.000\u00a0valores num\u00e9ricos de concentraciones de part\u00edculas (PM) mediante 10\u00a0sensores de calidad del aire para PM1, PM2.5 y PM10. Adem\u00e1s, se capturaron im\u00e1genes a\u00e9reas con un dron a distintas alturas (10\u00a0m, 20\u00a0m, 30\u00a0m) durante las horas de funcionamiento; las im\u00e1genes se entrenar\u00e1n con im\u00e1genes satelitales para la predicci\u00f3n de los valores de PM.<\/p>\n<p>Una encuesta preliminar indica que los mataderos en pa\u00edses en desarrollo dependen en gran medida de la madera y, a veces, de los neum\u00e1ticos de descarte para el procesamiento de la carne. El uso de estos elementos para el procesamiento de la carne libera una cantidad significativa de gases contaminantes. En horas de la ma\u00f1ana, se observa un humo espeso en las cercan\u00edas de estos mataderos mientras se procesa la carne. El humo de la combusti\u00f3n de madera, junto con un movimiento m\u00ednimo del aire debido al viento, puede provocar concentraciones elevadas de part\u00edculas en los mataderos. La exposici\u00f3n a las part\u00edculas y al carbono negro liberados en los mataderos tiene consecuencias perjudiciales para la salud, con una elevada morbilidad y mortalidad, como demuestran estudios anteriores. Este proyecto fue llevado a cabo por la Alliance for Progressive and Sustainable Environment (APSE), una organizaci\u00f3n local sin fines de lucro centrada en la sostenibilidad medioambiental (vea m\u00e1s detalles aqu\u00ed: <a href=\"http:\/\/www.apse-ngo.org\">www.apse-ngo.org<\/a>).<\/p>\n<p><strong>Autores y afiliaciones:<\/strong><\/p>\n<ul>\n<li><span><strong>Alliance for Progressive and Sustainable Environment: <\/strong>Emmanuel Chukwuma, Uche Okonkwo, Chukwuemeka Umeobi, Jervis Okafor, Sixtus Ezenwankwo, Shadrach Ugwu, Awonge Precious, Cynthia Egdede, Esther Eyo<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos: <\/strong><a href=\"https:\/\/drive.google.com\/drive\/folders\/1BRrVgYN-O6s7EsnEgAUCGqINvvfiXZC8?usp=drive_link\">https:\/\/drive.google.com\/drive\/folders\/1BRrVgYN-O6s7EsnEgAUCGqINvvfiXZC8?usp=drive_link<\/a><\/p>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>Conjunto de datos sobre irradiancia horizontal global para Mauricio, Rodrigues y Agal\u00e9ga<\/strong><\/span><\/h3>\n<p><strong>Pa\u00eds:<\/strong> Mauricio, Rodrigues y Agal\u00e9ga<\/p>\n<p>Este conjunto de datos incluye 146.025\u00a0l\u00edneas de datos de irradiancia solar en tiempo real procedentes de distintos lugares de Mauricio, Rodrigues y Agal\u00e9ga. Los datos de irradiancia solar (GHI en W\/m2) abarcan de 2017 a 2021, con un intervalo de una hora, y cubren las horas de 07:00 a 18:00 cada d\u00eda. Este conjunto de datos permite visualizar en tiempo real el perfil de irradiancia solar en los lugares especificados, lo que ayuda a evaluar y planificar mejor la energ\u00eda generada por el sol. El equipo ahora est\u00e1 recopilando datos (a partir de 2023) con un intervalo de 15\u00a0minutos y tiene previsto actualizar este repositorio de datos para reflejarlo en el futuro.<\/p>\n<p>El beneficiario de este proyecto es el gobierno de Mauricio, que tiene el objetivo de generar el 60\u00a0% de la electricidad a partir de fuentes de energ\u00eda renovables para el a\u00f1o 2030. Asimismo, la Agencia de Energ\u00eda Renovable de Mauricio, cuya tarea es garantizar que la demanda energ\u00e9tica del pa\u00eds se cubra principalmente con energ\u00eda renovable y se respeten los compromisos internacionales, puede utilizar estos datos sobre irradiancia solar y mecanismos de previsi\u00f3n para gestionar mejor las plantas de energ\u00eda de servicios p\u00fablicos, reducir las emisiones de carbono, garantizar que no haya p\u00e9rdida de carga (apagones) y permitir una mayor presencia de proyectos fotovoltaicos (PV) en el pa\u00eds. Con mapas solares en l\u00ednea gratuitos y datos sobre energ\u00eda solar de precisi\u00f3n mejorada, los operarios de plantas de PV locales tambi\u00e9n tendr\u00e1n informaci\u00f3n precisa para la evaluaci\u00f3n del rendimiento de PV. Adem\u00e1s, el p\u00fablico en general se puede beneficiar de una plataforma de energ\u00eda solar en l\u00ednea y gratuita que puede mejorar la aceptaci\u00f3n de la tecnolog\u00eda PV solar y aumentar la presencia de las tecnolog\u00edas limpias en el pa\u00eds para reducir a\u00fan m\u00e1s las emisiones de gases de efecto invernadero. Por \u00faltimo, los modelos de aprendizaje autom\u00e1tico pueden entrenarse para predicciones intradiarias, diarias e incluso semanales de los perfiles de irradiancia solar.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>Universidad de Mauricio: <\/strong>Yogesh Beeharry, Ravish Gokool, Yatindra Kumar Ramgolam, Aatish Chiniah<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos: <\/strong><a href=\"https:\/\/www.scidb.cn\/en\/detail?dataSetId=2b499b91a4464fffa9f60fc8b51da03e&amp;version=V2\">https:\/\/www.scidb.cn\/en\/detail?dataSetId=2b499b91a4464fffa9f60fc8b51da03e&amp;version=V2<\/a><\/p>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>Datos de paneles solares abiertos etiquetados <\/strong><strong>para medir la adopci\u00f3n de la energ\u00eda solar <\/strong><strong>en<\/strong><strong> Madagascar<\/strong><\/span><\/h3>\n<p><strong>Pa\u00eds: <\/strong>Madagascar<\/p>\n<p><strong>Contacto: Fabienne Rafidihariniri<\/strong><strong>na | <\/strong><a href=\"mailto:f.rafidiharinirina@association-maidi.mg\">f.rafidiharinirina@association-maidi.mg<\/a> o <a href=\"mailto:assomaidi@gmail.com\">assomaidi@gmail.com<\/a><\/p>\n<p>Este equipo anot\u00f3 2.125\u00a0im\u00e1genes satelitales de Google Earth y 9.202\u00a0im\u00e1genes de drones, y form\u00f3 una combinaci\u00f3n de vistas de paneles solares de baja y alta definici\u00f3n en Madagascar. El equipo de Madagascar Initiatives for Digital Innovation (MAIDI) realiz\u00f3 verificaciones de campo de hasta el 25\u00a0% de las im\u00e1genes satelitales y, en total, anot\u00f3 22.488\u00a0pol\u00edgonos.<\/p>\n<p>Este conjunto de datos ayudar\u00e1 a los cient\u00edficos de datos y a los usuarios a desarrollar un algoritmo de detecci\u00f3n de paneles solares para medir la adopci\u00f3n de la energ\u00eda solar en todo Madagascar. En particular, este proyecto represent\u00f3 a todas las regiones del pa\u00eds; en lugar de centrarse solo en las grandes ciudades, tambi\u00e9n abarc\u00f3 pueblos de tama\u00f1o promedio y peque\u00f1os, as\u00ed como costas y monta\u00f1as.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong>Fabienne Rafidiharinirina (Madagascar Initiatives for Digital Innovation)<\/p>\n<p><strong>Conjunto de datos: <\/strong><a href=\"https:\/\/openstat-madagascar.com\/bdd\/energie-et-environnement\/131-donnees-sur-l-energie-solaire-et-labellisation-d-images-de-panneaux-photovoltaiques-a-madagascar\">https:\/\/openstat-madagascar.com\/bdd\/energie-et-environnement\/131-donnees-sur-l-energie-solaire-et-labellisation-d-images-de-panneaux-photovoltaiques-a-madagascar<\/a><\/p>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>Conjunto de datos sobre energ\u00eda clim\u00e1tica para infraestructuras el\u00e9ctricas aisladas<\/strong><\/span><\/h3>\n<p><strong>Pa\u00eds:<\/strong> Pakist\u00e1n<\/p>\n<p><strong>Contacto: Dr.\u00a0Zeeshan Shafiq | <\/strong><a href=\"mailto:zeeshanshafiq@uetpeshawar.edu.pk\">zeeshanshafiq@uetpeshawar.edu.pk<\/a><\/p>\n<p>Este conjunto de datos comprende mediciones el\u00e9ctricas en tiempo real de una zona clim\u00e1tica espec\u00edfica de Pakist\u00e1n, la regi\u00f3n de Kalam, que muestran la generaci\u00f3n y la demanda de energ\u00eda dentro de una infraestructura el\u00e9ctrica sin conexi\u00f3n a la red. Puede utilizarse para la investigaci\u00f3n en el an\u00e1lisis de sistemas energ\u00e9ticos, estudios sobre el cambio clim\u00e1tico, ingenier\u00eda el\u00e9ctrica y aplicaciones de inteligencia artificial. Incluye tensiones, corrientes y factores de potencia para sistemas trif\u00e1sicos y monof\u00e1sicos en las etapas de generaci\u00f3n, distribuci\u00f3n y consumo. Adem\u00e1s, el conjunto de datos incorpora siete par\u00e1metros clim\u00e1ticos diferentes del conjunto de datos ERA5 (proporcionado por el Servicio de Cambio Clim\u00e1tico de Copernicus), generando un total de 85.596\u00a0puntos de datos en \u00e1reas como temperatura, punto de roc\u00edo, componentes del viento, precipitaciones, nevadas y cubierta de nieve.<\/p>\n<p>Recopilado cada cinco minutos desde el 3 de junio de 2023 hasta el 24 de octubre de 2024, incluye m\u00e1s de 45\u00a0millones de instancias que abarcan datos de cuatro microgeneradores hidroel\u00e9ctricos, 26\u00a0transformadores (adem\u00e1s de cuatro sistemas de adquisici\u00f3n de datos instalados en microcentrales hidroel\u00e9ctricas [MHP]) y 585\u00a0usuarios finales. Con el apoyo local, el equipo seguir\u00e1 supervisando los datos hasta junio de 2025.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>CISNR UET Peshawar: <\/strong>Zeeshan Shafiq, Prof. Dr.\u00a0Gul Muhammad Khan, Ing. Sarmad Rafique, Ing. Muhammad Bilal Khan, Ing. Umer Khan, Ing. Mansoor Khan, Ing. Niaz Khan, Ing. Musa Khan, Ing. Abdul Moiz<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos: <\/strong><a href=\"https:\/\/zenodo.org\/records\/14195731\">https:\/\/zenodo.org\/records\/14195731<\/a><\/p>\n<hr \/>\n<h2><span style=\"color: #2cb34a;\"><strong>Procesamiento del lenguaje natural<\/strong><\/span><\/h2>\n<p><em>Los conjuntos de datos de idiomas de Lacuna Fund crean recursos de texto y voz de libre acceso que alimentan las tecnolog\u00edas de procesamiento del lenguaje natural en diversos idiomas en contextos de ingresos bajos y medios de todo el mundo.<\/em><\/p>\n<h3><span style=\"color: #005a7c;\"><strong>NaijaVoices: nuestro idioma es nuestra fuerza<\/strong><\/span><\/h3>\n<p><strong>Idiomas: <\/strong>hausa, igbo y yoruba<\/p>\n<p><strong>Contacto: <\/strong>Para asociaciones, colaboraciones o preguntas, p\u00f3ngase en contacto con info@naijavoices.com.<\/p>\n<p>El proyecto NaijaVoices ha seleccionado 1.867\u00a0horas de datos de voz y texto que representan a m\u00e1s de 5.000\u00a0hablantes de los tres principales idiomas nigerianos: hausa, igbo y yoruba. Desde su lanzamiento, es el conjunto de datos de voz de m\u00faltiples hablantes africanos m\u00e1s grande. El conjunto de datos consta de unas 1.917.686\u00a0instancias; cada instancia est\u00e1 compuesta por audio, una transcripci\u00f3n, el idioma de la transcripci\u00f3n, la identificaci\u00f3n del hablante, el g\u00e9nero y el rango de edad. El conjunto de datos permite realizar tareas de NLP basadas en audio, como el reconocimiento autom\u00e1tico del habla (ASR) y la conversi\u00f3n de texto a voz (TTS). Adem\u00e1s, las oraciones aut\u00e9nticas del conjunto de datos pueden mejorar las tareas de procesamiento del lenguaje natural (NLP) basadas en textos, como el modelado del lenguaje, el etiquetado de partes del discurso y el reconocimiento de entidades con nombre.<\/p>\n<p>Las aplicaciones ling\u00fc\u00edsticas de este conjunto de datos incluyen la comprensi\u00f3n de los perfiles socioling\u00fc\u00edsticos, el an\u00e1lisis de las variaciones de pronunciaci\u00f3n, el estudio de las diferencias fon\u00e9ticas y fon\u00e9micas, y el avance de las capacidades de procesamiento del lenguaje natural (NLP) para los tres idiomas nigerianos. El m\u00e9todo NaijaVoices incorpor\u00f3 intencionadamente discursos sobre poblaciones marginadas, como las mujeres, los ni\u00f1os y las personas con discapacidad, as\u00ed como sobre \u00e1reas tem\u00e1ticas infrarrepresentadas, como los sistemas de recuento tradicionales y la agricultura. El conjunto de datos tambi\u00e9n representa voces diversas, con m\u00e1s de 5.000\u00a0participantes con patrones de habla y dialectos \u00fanicos.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong>Comunidad NaijaVoices (<a href=\"https:\/\/naijavoices.com\/\">https:\/\/naijavoices.com\/<\/a>)<\/p>\n<p><strong>Conjunto de datos: <\/strong><u>https:\/\/naijavoices.com\/dataset<\/u><\/p>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>AFRIDOC-MT: corpus de traducci\u00f3n autom\u00e1tica de documentos en idiomas africanos<\/strong><\/span><\/h3>\n<p><strong>Idiomas: <\/strong>amh\u00e1rico, hausa, swahili, yoruba y zul\u00fa<\/p>\n<p><strong>Contacto: Jesujoba O. Alabi<\/strong> | jalabi@lsv.uni-saarland.de<\/p>\n<p>AFRIDOC-MT es un conjunto de datos de traducci\u00f3n multidireccional y a nivel del documento del ingl\u00e9s a cinco idiomas africanos: amh\u00e1rico, hausa, swahili, yoruba y zul\u00fa. El conjunto de datos comprende 334\u00a0documentos de noticias sobre salud y 271 sobre tecnolog\u00edas de la informaci\u00f3n, todos ellos traducidos del ingl\u00e9s a estos idiomas por seres humanos. Cada dominio tiene al menos 10.000\u00a0oraciones paralelas por par de idiomas y admite la traducci\u00f3n multidireccional, lo que permite traducir no solo entre el ingl\u00e9s y los idiomas africanos, sino tambi\u00e9n entre los propios idiomas africanos.<\/p>\n<p>Este conjunto de datos se puede utilizar para evaluar la capacidad de los modelos de traducci\u00f3n autom\u00e1tica neuronal (NMT) y los modelos extensos de lenguaje (LLM) existentes para traducir a nivel del documento y para entrenar dichos modelos. Recientemente, se ha despertado el inter\u00e9s por la traducci\u00f3n a nivel del documento con m\u00faltiples oraciones, en la que las oraciones se traducen con su contexto y no de forma aislada. En el pasado, los esfuerzos se centraban en los idiomas de altos recursos, donde se dispone f\u00e1cilmente de conjuntos de datos a nivel del documento, y no en los idiomas africanos de bajos recursos. Adem\u00e1s, puede utilizarse para la traducci\u00f3n a nivel de la oraci\u00f3n y un par de tareas ling\u00fc\u00edsticas m\u00e1s si se anota adecuadamente.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>Universidad de Saarland:<\/strong> Jesujoba O. Alabi, Israel Abebe, Miaoran Zhang, Dawei Zhu, Dietrich Klakow<\/span><\/li>\n<li><span><strong>Centro Alem\u00e1n de Investigaci\u00f3n para la Inteligencia Artificial (DFKI)<\/strong>: Cristina Espa\u00f1a-Bonet<\/span><\/li>\n<li><span><strong>INRIA: <\/strong>Rachel Bawden<\/span><\/li>\n<li><span><strong>Universidad McGill y Mila:<\/strong> David Adelani<\/span><\/li>\n<li><span><strong>Universidad de Ibad\u00e1n: <\/strong>Clement Oyeleke Odoje, Idris Akinade<\/span><\/li>\n<li><span><strong>Instituto Nacional de Inform\u00e1tica (NII):<\/strong> Iffat Maab<\/span><\/li>\n<li><span><strong>Selcom: <\/strong>Davis David<\/span><\/li>\n<li><span><strong>Imperial College, Londres:<\/strong> Shamsuddeen Hassan<\/span><\/li>\n<li><span><strong>Universidad de KwaZulu-Natal: <\/strong>Nokwanda Putini<\/span><\/li>\n<li><span><strong>Universidad de Loughborough, Reino Unido:<\/strong> David Oluwajoju Ademuyiwa<\/span><\/li>\n<li><span><strong>Universidad de Cambridge:<\/strong> Andrew Caines<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos: <\/strong><a href=\"https:\/\/github.com\/masakhane-io\/afridoc-mt\">https:\/\/github.com\/masakhane-io\/afridoc-mt<\/a><\/p>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>NLU de MasaKhane: IA conversacional y conjuntos de datos de referencia para idiomas africanos<\/strong><\/span><\/h3>\n<p><strong>Idiomas: <\/strong>amh\u00e1rico, ewe, hausa, igbo, lingala, luganda, oromo, kinyarwanda, shona, sesotho, swahili, twi, wolof, xhosa, yoruba y zul\u00fa<\/p>\n<p><strong>Contacto: David Adelani | <\/strong>david.adelani@mila.quebec<\/p>\n<p>Este equipo ha desarrollado cinco conjuntos de datos de IA conversacional y de referencia para 16\u00a0idiomas de todo el continente africano: amh\u00e1rico, ewe, hausa, igbo, lingala, luganda, oromo, kinyarwanda, shona, sesotho, swahili, twi, wolof, xhosa, yoruba y zul\u00fa. El primer conjunto de datos, <strong>AfriXNLI<\/strong>, es un conjunto de datos de inferencia en lenguaje natural utilizado para determinar la relaci\u00f3n ling\u00fc\u00edstica (vinculaci\u00f3n, neutra y contradicci\u00f3n) entre dos oraciones; cuenta con 1.050\u00a0pares de oraciones por idioma. El segundo conjunto de datos, <strong>AfriMMLU,<\/strong> es un conjunto de datos de preguntas y respuestas de opci\u00f3n m\u00faltiple basado en el conocimiento que abarca cinco asignaturas: matem\u00e1ticas elementales, geograf\u00eda de escuela secundaria, derecho internacional, hechos globales y microeconom\u00eda de escuela secundaria. El equipo recopil\u00f3 608\u00a0pares de preguntas y respuestas por idioma. El tercer conjunto de datos, <strong>AfriMGSM<\/strong>, se desarroll\u00f3 como un conjunto de datos de forma libre de preguntas y respuestas de matem\u00e1ticas de primaria, que se form\u00f3 con 258\u00a0pares de preguntas y respuestas. <strong>AfriIntent<\/strong>, que implica la recopilaci\u00f3n de 3.200\u00a0oraciones por idioma, es un conjunto de datos de clasificaci\u00f3n intencionada que abarca numerosos dominios, como banca (p.\u00a0ej., \u201cpagar factura\u201d), hogar (p.\u00a0ej., \u201creproducir m\u00fasica\u201d), cocina y cena (p.\u00a0ej., \u201cconfirmar reserva\u201d), viajes (p.\u00a0ej., \u201ctipo de tomacorriente\u201d) y servicios (p.\u00a0ej., \u201chacer una llamada\u201d). Por \u00faltimo, utilizando 3.200\u00a0oraciones por idioma, el equipo desarroll\u00f3 <strong>AfriSlot<\/strong> para la clasificaci\u00f3n por secciones en categor\u00edas como productos alimenticios, nombres de idiomas, etc.<\/p>\n<p>Estos cinco conjuntos de datos de solo texto son \u00fatiles para chatbots conversacionales en aplicaciones de la vida real, como banca, restaurantes, agencias de viajes y m\u00e1s. El equipo ha creado puntos de referencia s\u00f3lidos para evaluar el rendimiento de modelos extensos de lenguaje como GPT-4o en idiomas africanos.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>Universidad McGill y Mila<\/strong>: David Ifeoluwa Adelani, Hao Yu<\/span><\/li>\n<li><span><strong>SADiLaR<\/strong>: Andiswa Bukula, Mmasibidi Setaka, Rooweither Mabuya<\/span><\/li>\n<li><span><strong>Universidad OntarioTech<\/strong>: En-Shiun Annie Lee<\/span><\/li>\n<li><span><strong>Universidad de Saarland<\/strong>: Israel Abebe Azime, Jesujoba O. Alabi<\/span><\/li>\n<li><span><strong>Universidad de Toronto<\/strong>: Jian Yun Zhuang<\/span><\/li>\n<li><span><strong>Universidad de Princeton<\/strong>: Happy Buzaaba<\/span><\/li>\n<li><span><strong>Masakhane<\/strong>: Blessing Sibanda, Godson Kalipe, Jonathan Mukiibi, Salomon Kabongo, Lolwethu Ndolela, Nkiruka Odu, Salomey Osei, Sokhar Samb, Tadesse Kebede Guge, Juliet Murage<\/span><\/li>\n<li><span><strong>Imperial College<\/strong>: Shamsuddeen Hassan Muhammad<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos:<\/strong> <a href=\"https:\/\/github.com\/masakhane-io\/masakhane-nlu\">https:\/\/github.com\/masakhane-io\/masakhane-nlu<\/a><\/p>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>Conjunto de datos multiling\u00fces de PII de Lacuna<\/strong><\/span><\/h3>\n<p><strong>Idiomas: <\/strong>luganda, lumasaba, hausa y kanuri<\/p>\n<p><strong>Contacto: <\/strong><\/p>\n<ul>\n<li><span><strong>Andrew Katumba<\/strong>|katumba@mak.ac.ug<\/span><\/li>\n<li><span><strong>Milena Haykowska<\/strong>|milena.haykowska@clearglobal.org<\/span><\/li>\n<li><span><strong>Peter Nabende|<\/strong>nabende@gmail.com<\/span><\/li>\n<\/ul>\n<p>Este conjunto de datos contiene oraciones anotadas con informaci\u00f3n de identificaci\u00f3n personal (PII) en luganda, lumasaba, hausa y kanuri. Estos cuatro idiomas abarcan Uganda central y oriental, Nigeria, Ghana y el norte de Camer\u00fan. El equipo recopil\u00f3 3.000\u00a0oraciones tanto para kanuri como para hausa, 5.000 para lumasaba y 4.000 para luganda. Entre los posibles usos de estos conjuntos de datos se encuentran el reconocimiento de entidades con nombre (NER), la clasificaci\u00f3n de textos, el an\u00e1lisis y la investigaci\u00f3n de datos para preservar la privacidad, el modelado del lenguaje, la traducci\u00f3n autom\u00e1tica y la investigaci\u00f3n ling\u00fc\u00edstica.<\/p>\n<p>El objetivo del equipo era recopilar un conjunto de datos que incluyera la perspectiva de g\u00e9nero, y su trabajo puso de manifiesto la necesidad de disponer de directrices estandarizadas para la anotaci\u00f3n de idiomas de bajos recursos. Disponer de estas directrices ayudar\u00eda a evitar los errores m\u00e1s comunes a la hora de etiquetar datos de texto en estos idiomas de bajos recursos.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>Laboratorio de Investigaci\u00f3n e Innovaciones Marconi, Universidad de Makerere<\/strong>: Andrew Katumba, Jenifer Winfred Namuyanja, Nakakande Bridget Cecile<\/span><\/li>\n<li><span><strong>Laboratorio de Inteligencia Artificial de Makerere<\/strong>: Joyce Nakatumba-Nabende, Ann Lisa Nabiryo, Peter Nabende, Eric Peter Wairagala<\/span><\/li>\n<li><span><strong>Clear Global: <\/strong>Milena Haykowska, Andrew Bredenkamp, Mariam Mohanna, Alp \u00d6ktem, Etienne de Crecy<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos: <\/strong><a href=\"https:\/\/doi.org\/10.7910\/DVN\/CGHWZE\">https:\/\/doi.org\/10.7910\/DVN\/CGHWZE<\/a><\/p>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>Conjunto de datos sobre la detecci\u00f3n de discurso ofensivo y de odio para idiomas africanos<\/strong><\/span><\/h3>\n<p><strong>Idiomas: <\/strong>hausa, yoruba, igbo, pidgin nigeriano, \u00e1rabe argelino, \u00e1rabe marroqu\u00ed, swahili, isiXhosa, isiZulu, kinyarwanda, twi, amh\u00e1rico, oromo, somal\u00ed, tigri\u00f1a<\/p>\n<p><strong>Contacto: <\/strong><\/p>\n<ul>\n<li><span><strong>Abinew Ali Ayele |<\/strong> <a href=\"mailto:abinewaliayele@gmail.com\">abinewaliayele@gmail.com<\/a><\/span><\/li>\n<li><span><strong>Seid Muhie Yiman | <\/strong><a href=\"mailto:seid.muhie.yimam@uni-hamburg.de\">muhie.yimam@uni-hamburg.de<\/a><\/span><\/li>\n<li><span><strong>Shamsuddeen Hassan Muhammad | <\/strong><a href=\"mailto:shamsuddeen2004@gmail.com\">muhammad@imperial.ac.uk<\/a><\/span><\/li>\n<\/ul>\n<p>AfriHate es un corpus de discursos ofensivos y de odio para 15\u00a0idiomas africanos: hausa, yoruba, igbo, pidgin nigeriano, \u00e1rabe argelino, \u00e1rabe marroqu\u00ed, swahili, isiXhosa, isiZulu, kinyarwanda, twi, amh\u00e1rico, oromo, somal\u00ed, tigri\u00f1a. El conjunto de datos AfriHate anot\u00f3 tuits utilizando clases \u201cofensivas\u201d, \u201codiosas\u201d y \u201cnormales\u201d, con clases objetivo espec\u00edficas (temas) como pol\u00edtica, etnia, g\u00e9nero, religi\u00f3n y discapacidad. Dentro de este proyecto, el equipo cre\u00f3 otro conjunto de datos, AfriEmotion, un nuevo corpus para la detecci\u00f3n de emociones, incluida la intensidad de emociones como la alegr\u00eda, la tristeza, el miedo, la ira, la sorpresa y el asco. En total, el equipo recopil\u00f3 y anot\u00f3 10.000\u00a0casos de cada uno para la detecci\u00f3n de expresiones de odio y ofensivas y de emociones por idioma, lo que supone un total de 150.000\u00a0observaciones anotadas.<\/p>\n<p>Este proyecto es el primero en desarrollar y poner a disposici\u00f3n del p\u00fablico un conjunto de datos para la detecci\u00f3n de discursos de odio y ofensivos y de emociones en los idiomas de destino. Para garantizar un conjunto de datos representativo, los idiomas de destino abarcan todas las regiones de \u00c1frica. Asimismo, para cada idioma, el equipo recopil\u00f3 textos utilizando un conjunto diverso de estrategias para garantizar una representaci\u00f3n homog\u00e9nea en el corpus y recurri\u00f3 a anotadores de procedencia diversa en cuanto a g\u00e9nero, estatus y nivel educativo.<\/p>\n<p>El conjunto de datos AfriHate admite diversas tareas y aplicaciones de procesamiento del lenguaje natural (NLP) para los idiomas africanos, como la detecci\u00f3n de discursos de odio, la identificaci\u00f3n de lenguaje abusivo, el an\u00e1lisis contextual y el modelado ling\u00fc\u00edstico. Sirve para varios casos de uso, como la investigaci\u00f3n psicol\u00f3gica, la elaboraci\u00f3n de pol\u00edticas y la moderaci\u00f3n de contenidos. El conjunto de datos ayuda a detectar eficazmente los discursos de odio en entornos ling\u00fc\u00edsticos de bajos recursos, identificar patrones ling\u00fc\u00edsticos de discursos de odio, comprender las influencias contextuales y mejorar las herramientas de NLP para la moderaci\u00f3n matizada de contenidos en idiomas africanos.<\/p>\n<p>Del mismo modo, el conjunto de datos AfriEmotion facilita diversas tareas y aplicaciones de NLP para idiomas africanos, como la detecci\u00f3n, el an\u00e1lisis y la s\u00edntesis de emociones. Sus casos de uso incluyen el seguimiento de las redes sociales para comprender el sentimiento y las emociones del p\u00fablico, el apoyo a la salud mental con detecci\u00f3n temprana de la angustia, herramientas educativas que promuevan la inteligencia emocional, el an\u00e1lisis literario a trav\u00e9s de una mirada emocional y perspectivas pol\u00edticas para una toma de decisiones informada. El conjunto de datos aborda cuestiones como las influencias ling\u00fc\u00edsticas y culturales en la expresi\u00f3n emocional, las similitudes y diferencias entre idiomas y culturas, la adaptaci\u00f3n de modelos de NLP para los idiomas de bajos recursos, y los desaf\u00edos y las oportunidades del procesamiento multiling\u00fce de emociones en contextos africanos.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>ICT4D, Universidad de Bahir Dar:<\/strong> Esubalew Alemneh Jalew, Abinew Ali Ayele<\/span><\/li>\n<li><span><strong>Universidad Bayero de Kano, Departamento de Inform\u00e1tica: <\/strong>Shamsudeen Hassan Muhammad, Ibrahim Said Ahmad<\/span><\/li>\n<li><span><strong>Imperial College de Londres:<\/strong> Shamsuddeen Hassan Muhammad<\/span><\/li>\n<li><span><strong>Idris Abdulmumin<\/strong> (Universidad Ahmadu Bello, Departamento de Inform\u00e1tica).<\/span><\/li>\n<li><span>Seid Muhie Yimam (Universidad de Hamburgo, Grupo de Tecnolog\u00eda Ling\u00fc\u00edstica, Departamento de Inform\u00e1tica)<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos: <\/strong><\/p>\n<ul>\n<li><span><a href=\"https:\/\/github.com\/AfriHate\/AfriHate\">https:\/\/github.com\/AfriHate\/AfriHate<\/a><\/span><\/li>\n<li><span><a href=\"https:\/\/github.com\/AfriEmotion\/AfriEmotion\">https:\/\/github.com\/AfriEmotion\/AfriEmotion<\/a><\/span><\/li>\n<\/ul>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>Ethio Speech Corpora<\/strong><\/span><\/h3>\n<p><strong>Idiomas: <\/strong>amh\u00e1rico, tigri\u00f1a, oromo, somal\u00ed, afar, sidama<\/p>\n<p><strong>Contacto: Solomon Teferra Abate | <\/strong>solomon.teferra@aau.edu.et<\/p>\n<p>Ethio Speech Corpora est\u00e1 compuesto por m\u00e1s de 391\u00a0horas de audio grabado en seis\u00a0idiomas et\u00edopes diferentes: amh\u00e1rico (68\u00a0horas), tigri\u00f1a (62\u00a0horas), oromo (70\u00a0horas), somal\u00ed (56\u00a0horas), afar (68\u00a0horas) y sidama (68\u00a0horas). Este proyecto ser\u00e1 un recurso valioso para el desarrollo de sistemas de reconocimiento autom\u00e1tico del habla (ASR) de buen rendimiento para estos seis\u00a0idiomas (en una configuraci\u00f3n monoling\u00fce) y para otros idiomas relacionados (en una configuraci\u00f3n multiling\u00fce) que son \u00fatiles en numerosos aspectos de la vida diaria.<\/p>\n<p>Los casos de uso de los sistemas de reconocimiento del habla que utilizan este conjunto de datos incluyen sistemas de dictado, sistemas de transcripci\u00f3n, tecnolog\u00edas de asistencia, sistemas de di\u00e1logo hablado, traducci\u00f3n del habla y otras tecnolog\u00edas del habla similares. Para que el conjunto de datos fuera representativo, el equipo seleccion\u00f3 seis\u00a0idiomas de trabajo que se utilizan en todos los estados regionales de Etiop\u00eda, manteniendo al mismo tiempo el equilibrio de g\u00e9nero y edad de los lectores.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>Facultad de Ciencias de la Informaci\u00f3n de la Universidad de Addis Abeba: <\/strong>Solomon Teferra Abate (PhD), Martha Yifiru Tachbelie (PhD), Michael Melese Woldeyohannes (PhD), Hafte Abera, Bantegize Addis Alemayehu, Wondwossen Mulugeta (PhD)<\/span><\/li>\n<\/ul>\n<p><strong>Sitio web: <\/strong><a href=\"https:\/\/ethiospeech.com\/\">https:\/\/ethiospeech.com\/<\/a><\/p>\n<p><strong>Conjunto de datos: <\/strong><a href=\"https:\/\/github.com\/EthioSpeech\">https:\/\/github.com\/EthioSpeech<\/a> y <a href=\"https:\/\/huggingface.co\/EthioSpeech\">https\/:\/huggingface.co\/EthioSpeech<\/a><\/p>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>Crear un corpus en paralelo para las lenguas ind\u00edgenas de Kenia y kiswahili<\/strong><\/span><\/h3>\n<p><strong>Idiomas: <\/strong>kidaw&#8217;ida, kalenjin y dholuo, kiswahili<\/p>\n<p><strong>Contacto: Audrey Mbogho | <\/strong>ambogho@usiu.ac.ke<\/p>\n<p>Este equipo recopil\u00f3 corpus de texto en paralelo para tres lenguas ind\u00edgenas de Kenia, kidaw&#8217;ida, kalenjin y dholuo, junto con kiswahili, lo que condujo a cerca de 90.000\u00a0pares de oraciones en total. Tras la recopilaci\u00f3n, el equipo separ\u00f3 las oraciones en kidaw&#8217;ida, kalenjin y dholuo y las utiliz\u00f3 como conjuntos de datos monoling\u00fces para datos de habla de participaci\u00f3n colectiva, lo que fue posible gracias a la carga de las oraciones en Mozilla Common Voice. Se reclut\u00f3 a un total de 109\u00a0miembros de las tres comunidades ling\u00fc\u00edsticas para que leyeran y grabaran oraciones de sus respectivos idiomas nativos. Hacer hincapi\u00e9 en el equilibrio de g\u00e9nero e incluir distintas edades y variantes regionales ayud\u00f3 a que los conjuntos de datos fueran m\u00e1s representativos. Los conjuntos de datos de voz ofrecen una cantidad considerable de datos de habla: 56\u00a0horas de kidaw&#8217;ida, 92\u00a0horas de kalenjin y 120\u00a0horas de dholuo, lo que supone un total de 268\u00a0horas.<\/p>\n<p>Los casos de uso para estos corpus en paralelo incluyen el entrenamiento de modelos para traducir entre kiswahili y kidaw&#8217;ida, Kalenjin y dholuo. Los datos de voz de Mozilla Common Voice, junto con sus datos de texto asociados, se utilizar\u00e1n para el desarrollo de aplicaciones de reconocimiento de voz. Los idiomas que componen este conjunto de datos son de bajos recursos, especialmente el kidaw&#8217;ida, que solo cuenta con unos 400.000\u00a0hablantes y se enfrenta a un riesgo de p\u00e9rdida m\u00e1s inmediato. Al recopilar los datos de texto y voz, este equipo contribuy\u00f3 a la conservaci\u00f3n de estas lenguas. Esperan que, una vez recopilados suficientes datos para entrenar modelos precisos y crear aplicaciones de NLP para estas tres lenguas, estas adquieran mayor relevancia en la era digital moderna, mitigando as\u00ed el riesgo de p\u00e9rdida.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>USIU-Africa: <\/strong>Audrey Mbogho, Quin Awuor<\/span><\/li>\n<li><span><strong>Universidad de Maseno: <\/strong>Lilian Wanzare, Vivian Oloo<\/span><\/li>\n<li><span><strong>Andrew Kipkebut<\/strong> (Universidad de Kabarak)<\/span><\/li>\n<li><span><strong>Rose Lugano <\/strong>(Universidad de Florida)<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos: <\/strong><\/p>\n<ul>\n<li><span><a href=\"https:\/\/zenodo.org\/records\/13355021\">https:\/\/zenodo.org\/records\/13355021<\/a><\/span><\/li>\n<li><strong>Mozilla Common Voice:<\/strong>\n<ul>\n<li><span><a href=\"https:\/\/commonvoice.mozilla.org\/dav\/datasets\">https:\/\/commonvoice.mozilla.org\/dav\/datasets<\/a><\/span><\/li>\n<li><span><a href=\"https:\/\/commonvoice.mozilla.org\/kln\/datasets\">https:\/\/commonvoice.mozilla.org\/kln\/datasets<\/a><\/span><\/li>\n<li><span><a href=\"https:\/\/commonvoice.mozilla.org\/luo\/datasets\">https:\/\/commonvoice.mozilla.org\/luo\/datasets<\/a><\/span><\/li>\n<\/ul>\n<\/li>\n<\/ul>\n<hr \/>\n<h3><span style=\"color: #005a7c;\"><strong>Ampliar un corpus en paralelo en portugu\u00e9s y el idioma bant\u00fa emakhuwa<\/strong><\/span><\/h3>\n<p><strong>Idiomas: <\/strong>emakhuwa, portugu\u00e9s<\/p>\n<p><strong>Contacto: Felermino D. M.<\/strong><strong> A. Ali |<\/strong> <a href=\"mailto:felermino.ali@unilurio.ac.mz\">felermino.ali@unilurio.ac.mz<\/a> o <a href=\"mailto:felerminoali@gmail.com\">felerminoali@gmail.com<\/a><\/p>\n<p>Este conjunto de datos incluye la traducci\u00f3n de 1.897\u00a0art\u00edculos de noticias con 660.242\u00a0palabras del portugu\u00e9s al emakhuwa, una lengua ind\u00edgena de Mozambique. Cada art\u00edculo incluye el titular de la noticia, el contenido y una etiqueta para la clasificaci\u00f3n tem\u00e1tica. Para la clasificaci\u00f3n tem\u00e1tica de las noticias, los art\u00edculos se dividieron en tres \u00e1reas principales: capacitaci\u00f3n (1.337\u00a0art\u00edculos), desarrollo (185\u00a0art\u00edculos) y pruebas (375\u00a0art\u00edculos). Luego, los art\u00edculos se clasificaron por tema: pol\u00edtica, econom\u00eda, cultura, deportes, salud, sociedad y noticias del mundo.<\/p>\n<p>Los casos de uso para este conjunto de datos incluyen la clasificaci\u00f3n de temas, la traducci\u00f3n y el reconocimiento de extranjerismos. Para garantizar que el conjunto de datos fuera representativo, el equipo tradujo diferentes categor\u00edas de art\u00edculos de noticias y prioriz\u00f3 aquellos relacionados con Mozambique, lo que contribuy\u00f3 a la diversidad del l\u00e9xico. Los conjuntos de datos han mostrado resultados prometedores a la hora de perfeccionar modelos multiling\u00fces como ByT5, M2M100 y NLLB200. El trabajo del equipo ya ha generado mejoras en la calidad de traducci\u00f3n al utilizar informaci\u00f3n de extranjerismos como datos adicionales. Tienen previsto seguir perfeccionando los modelos y garantizar resultados de alta calidad para todos los casos de uso.<\/p>\n<p><strong>Autores y afiliaciones: <\/strong><\/p>\n<ul>\n<li><span><strong>Felermino D\u00e1rio M\u00e1rio Ant\u00f3nio Ali<\/strong>: Universidad Lurio, Facultad de Ingenier\u00eda; Laboratorio de Inteligencia Artificial e Inform\u00e1tica (LIACC); Centro de Ling\u00fc\u00edstica (CLUP) de la Universidad de Porto<\/span><\/li>\n<li><span><strong>Henrique Lopes Cardoso<\/strong>: Facultad de Ingenier\u00eda de la Universidad de Porto (FEUP), Laboratorio de Inteligencia Artificial e Inform\u00e1tica (LIACC)<\/span><\/li>\n<li><span><strong>Rui Sousa Silva<\/strong>: Facultad de Letras y Humanidades, Centro de Ling\u00fc\u00edstica (CLUP) de la Universidad de Porto<\/span><\/li>\n<\/ul>\n<p><strong>Conjunto de datos: <\/strong><a href=\"https:\/\/huggingface.co\/collections\/LIACC\/makhuwa-nlp-66a93ea22df7f4b31e96a5ab\">https:\/\/huggingface.co\/collections\/LIACC\/makhuwa-nlp-66a93ea22df7f4b31e96a5ab<\/a><\/p>\n<p><strong>Documentos: <\/strong><\/p>\n<ul>\n<li><span><a href=\"https:\/\/aclanthology.org\/2024.emnlp-main.824\">https:\/\/aclanthology.org\/2024.emnlp-main.824<\/a><\/span><\/li>\n<li><span><a href=\"https:\/\/aclanthology.org\/2024.lrec-main.425\">https:\/\/aclanthology.org\/2024.lrec-main.425<\/a><\/span><\/li>\n<li><span><a href=\"https:\/\/aclanthology.org\/2024.wmt-1.45\">https:\/\/aclanthology.org\/2024.wmt-1.45<\/a><\/span><\/li>\n<\/ul>\n<p>&nbsp;<\/p>\n<h4><strong><span style=\"color: #2cb34a;\">Para ver todos los conjuntos de datos de idiomas de Lacuna Fund, visite:<\/span> <\/strong><a href=\"https:\/\/lacunafund.org\/datasets\/language\/\"><strong>https:\/\/lacunafund.org\/datasets\/language\/<\/strong><\/a><\/h4>\n","protected":false},"excerpt":{"rendered":"<p>Publicaci\u00f3n de 18\u00a0nuevos conjuntos de datos de IA en los \u00e1mbitos de la agricultura, el clima, la salud y el idioma Hoy nos complace anunciar la reciente publicaci\u00f3n de dieciocho conjuntos de datos para entrenar la inteligencia artificial (IA) en los \u00e1mbitos de la agricultura, el clima, la salud y el procesamiento del lenguaje natural &hellip; <a href=\"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/\">Continued<\/a><\/p>\n","protected":false},"author":37,"featured_media":0,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"footnotes":""},"categories":[35,42,33,36],"tags":[],"class_list":["post-12629","post","type-post","status-publish","format-standard","hentry","category-agricultura","category-clima","category-idioma","category-salud"],"acf":[],"yoast_head":"<!-- This site is optimized with the Yoast SEO plugin v25.5 - https:\/\/yoast.com\/wordpress\/plugins\/seo\/ -->\n<title>Lacuna Fund publica 18 nuevos conjuntos de datos de inteligencia artificial (IA) que ayudan a las comunidades locales a abordar los desaf\u00edos de la agricultura, el clima, la salud y el idioma - Lacuna Fund<\/title>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/\" \/>\n<meta property=\"og:locale\" content=\"es_ES\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"Lacuna Fund publica 18 nuevos conjuntos de datos de inteligencia artificial (IA) que ayudan a las comunidades locales a abordar los desaf\u00edos de la agricultura, el clima, la salud y el idioma - Lacuna Fund\" \/>\n<meta property=\"og:description\" content=\"Publicaci\u00f3n de 18\u00a0nuevos conjuntos de datos de IA en los \u00e1mbitos de la agricultura, el clima, la salud y el idioma Hoy nos complace anunciar la reciente publicaci\u00f3n de dieciocho conjuntos de datos para entrenar la inteligencia artificial (IA) en los \u00e1mbitos de la agricultura, el clima, la salud y el procesamiento del lenguaje natural &hellip; Continued\" \/>\n<meta property=\"og:url\" content=\"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/\" \/>\n<meta property=\"og:site_name\" content=\"Lacuna Fund\" \/>\n<meta property=\"article:published_time\" content=\"2025-03-12T23:05:49+00:00\" \/>\n<meta property=\"og:image\" content=\"https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2.png\" \/>\n\t<meta property=\"og:image:width\" content=\"1600\" \/>\n\t<meta property=\"og:image:height\" content=\"900\" \/>\n\t<meta property=\"og:image:type\" content=\"image\/png\" \/>\n<meta name=\"author\" content=\"sdollisso\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<meta name=\"twitter:label1\" content=\"Written by\" \/>\n\t<meta name=\"twitter:data1\" content=\"sdollisso\" \/>\n\t<meta name=\"twitter:label2\" content=\"Est. reading time\" \/>\n\t<meta name=\"twitter:data2\" content=\"28 minutes\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\/\/schema.org\",\"@graph\":[{\"@type\":\"WebPage\",\"@id\":\"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/\",\"url\":\"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/\",\"name\":\"Lacuna Fund publica 18 nuevos conjuntos de datos de inteligencia artificial (IA) que ayudan a las comunidades locales a abordar los desaf\u00edos de la agricultura, el clima, la salud y el idioma - Lacuna Fund\",\"isPartOf\":{\"@id\":\"https:\/\/lacunafund.org\/#website\"},\"primaryImageOfPage\":{\"@id\":\"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/#primaryimage\"},\"image\":{\"@id\":\"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/#primaryimage\"},\"thumbnailUrl\":\"https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-300x169.png\",\"datePublished\":\"2025-03-12T23:05:49+00:00\",\"author\":{\"@id\":\"https:\/\/lacunafund.org\/#\/schema\/person\/ee092c64e4ea94cc8539863f6a2c0793\"},\"breadcrumb\":{\"@id\":\"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/#breadcrumb\"},\"inLanguage\":\"es-ES\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/\"]}]},{\"@type\":\"ImageObject\",\"inLanguage\":\"es-ES\",\"@id\":\"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/#primaryimage\",\"url\":\"https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-300x169.png\",\"contentUrl\":\"https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-300x169.png\"},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/#breadcrumb\",\"itemListElement\":[{\"@type\":\"ListItem\",\"position\":1,\"name\":\"Home\",\"item\":\"https:\/\/lacunafund.org\/es\/\"},{\"@type\":\"ListItem\",\"position\":2,\"name\":\"Lacuna Fund publica 18 nuevos conjuntos de datos de inteligencia artificial (IA) que ayudan a las comunidades locales a abordar los desaf\u00edos de la agricultura, el clima, la salud y el idioma\"}]},{\"@type\":\"WebSite\",\"@id\":\"https:\/\/lacunafund.org\/#website\",\"url\":\"https:\/\/lacunafund.org\/\",\"name\":\"Lacuna Fund\",\"description\":\"Just another Meridian Institute Sites site\",\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\/\/lacunafund.org\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"es-ES\"},{\"@type\":\"Person\",\"@id\":\"https:\/\/lacunafund.org\/#\/schema\/person\/ee092c64e4ea94cc8539863f6a2c0793\",\"name\":\"sdollisso\",\"image\":{\"@type\":\"ImageObject\",\"inLanguage\":\"es-ES\",\"@id\":\"https:\/\/lacunafund.org\/#\/schema\/person\/image\/\",\"url\":\"https:\/\/secure.gravatar.com\/avatar\/737b07047cc39b084aabd2234dbc8b38484b5a7ef56ba3e0e70ee40ff77b0b57?s=96&d=mm&r=g\",\"contentUrl\":\"https:\/\/secure.gravatar.com\/avatar\/737b07047cc39b084aabd2234dbc8b38484b5a7ef56ba3e0e70ee40ff77b0b57?s=96&d=mm&r=g\",\"caption\":\"sdollisso\"},\"url\":\"https:\/\/lacunafund.org\/es\/author\/sdollisso\/\"}]}<\/script>\n<!-- \/ Yoast SEO plugin. -->","yoast_head_json":{"title":"Lacuna Fund publica 18 nuevos conjuntos de datos de inteligencia artificial (IA) que ayudan a las comunidades locales a abordar los desaf\u00edos de la agricultura, el clima, la salud y el idioma - Lacuna Fund","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/","og_locale":"es_ES","og_type":"article","og_title":"Lacuna Fund publica 18 nuevos conjuntos de datos de inteligencia artificial (IA) que ayudan a las comunidades locales a abordar los desaf\u00edos de la agricultura, el clima, la salud y el idioma - Lacuna Fund","og_description":"Publicaci\u00f3n de 18\u00a0nuevos conjuntos de datos de IA en los \u00e1mbitos de la agricultura, el clima, la salud y el idioma Hoy nos complace anunciar la reciente publicaci\u00f3n de dieciocho conjuntos de datos para entrenar la inteligencia artificial (IA) en los \u00e1mbitos de la agricultura, el clima, la salud y el procesamiento del lenguaje natural &hellip; Continued","og_url":"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/","og_site_name":"Lacuna Fund","article_published_time":"2025-03-12T23:05:49+00:00","og_image":[{"width":1600,"height":900,"url":"https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2.png","type":"image\/png"}],"author":"sdollisso","twitter_card":"summary_large_image","twitter_misc":{"Written by":"sdollisso","Est. reading time":"28 minutes"},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"WebPage","@id":"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/","url":"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/","name":"Lacuna Fund publica 18 nuevos conjuntos de datos de inteligencia artificial (IA) que ayudan a las comunidades locales a abordar los desaf\u00edos de la agricultura, el clima, la salud y el idioma - Lacuna Fund","isPartOf":{"@id":"https:\/\/lacunafund.org\/#website"},"primaryImageOfPage":{"@id":"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/#primaryimage"},"image":{"@id":"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/#primaryimage"},"thumbnailUrl":"https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-300x169.png","datePublished":"2025-03-12T23:05:49+00:00","author":{"@id":"https:\/\/lacunafund.org\/#\/schema\/person\/ee092c64e4ea94cc8539863f6a2c0793"},"breadcrumb":{"@id":"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/#breadcrumb"},"inLanguage":"es-ES","potentialAction":[{"@type":"ReadAction","target":["https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/"]}]},{"@type":"ImageObject","inLanguage":"es-ES","@id":"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/#primaryimage","url":"https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-300x169.png","contentUrl":"https:\/\/lacunafund.org\/wp-content\/uploads\/sites\/11\/2025\/03\/HEADER-IMAGE-FINAL-18-New-Datasets-2-300x169.png"},{"@type":"BreadcrumbList","@id":"https:\/\/lacunafund.org\/es\/lacuna-fund-publica-18-nuevos-conjuntos-de-datos-de-inteligencia-artificial-ia-que-ayudan-a-las-comunidades-locales-a-abordar-los-desafios-de-la-agricultura-el-clima-la-salud-y-el-idioma\/#breadcrumb","itemListElement":[{"@type":"ListItem","position":1,"name":"Home","item":"https:\/\/lacunafund.org\/es\/"},{"@type":"ListItem","position":2,"name":"Lacuna Fund publica 18 nuevos conjuntos de datos de inteligencia artificial (IA) que ayudan a las comunidades locales a abordar los desaf\u00edos de la agricultura, el clima, la salud y el idioma"}]},{"@type":"WebSite","@id":"https:\/\/lacunafund.org\/#website","url":"https:\/\/lacunafund.org\/","name":"Lacuna Fund","description":"Just another Meridian Institute Sites site","potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/lacunafund.org\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"es-ES"},{"@type":"Person","@id":"https:\/\/lacunafund.org\/#\/schema\/person\/ee092c64e4ea94cc8539863f6a2c0793","name":"sdollisso","image":{"@type":"ImageObject","inLanguage":"es-ES","@id":"https:\/\/lacunafund.org\/#\/schema\/person\/image\/","url":"https:\/\/secure.gravatar.com\/avatar\/737b07047cc39b084aabd2234dbc8b38484b5a7ef56ba3e0e70ee40ff77b0b57?s=96&d=mm&r=g","contentUrl":"https:\/\/secure.gravatar.com\/avatar\/737b07047cc39b084aabd2234dbc8b38484b5a7ef56ba3e0e70ee40ff77b0b57?s=96&d=mm&r=g","caption":"sdollisso"},"url":"https:\/\/lacunafund.org\/es\/author\/sdollisso\/"}]}},"_links":{"self":[{"href":"https:\/\/lacunafund.org\/es\/wp-json\/wp\/v2\/posts\/12629","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/lacunafund.org\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/lacunafund.org\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/lacunafund.org\/es\/wp-json\/wp\/v2\/users\/37"}],"replies":[{"embeddable":true,"href":"https:\/\/lacunafund.org\/es\/wp-json\/wp\/v2\/comments?post=12629"}],"version-history":[{"count":4,"href":"https:\/\/lacunafund.org\/es\/wp-json\/wp\/v2\/posts\/12629\/revisions"}],"predecessor-version":[{"id":12642,"href":"https:\/\/lacunafund.org\/es\/wp-json\/wp\/v2\/posts\/12629\/revisions\/12642"}],"wp:attachment":[{"href":"https:\/\/lacunafund.org\/es\/wp-json\/wp\/v2\/media?parent=12629"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/lacunafund.org\/es\/wp-json\/wp\/v2\/categories?post=12629"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/lacunafund.org\/es\/wp-json\/wp\/v2\/tags?post=12629"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}