| Nome de Conjunto de Dados | Dispositivo de Gravação | Volume de Dados | Características |
| Corpus de Síntese de Fala em Inglês – 4 Países, 2 Hora | Microphone | 2 horas de áudio (4 locutores) | Locutores: 4 falantes nativos (EUA, Reino Unido, Austrália, Nova Zelândia) Formato de Áudio: WAV não comprimido Parâmetros Técnicos: 48 kHz, 24 bits, mono Ambiente de Gravação: Estúdio profissional acusticamente tratado |
| 20 Horas – Leitura e Fala Conversacional em Português via Telemóvel | Smartphones | 20 horas de áudio | Formato de Áudio: WAV não comprimido, 16 kHz, 16 bits, mono Condições de Gravação: Ruído ambiente reduzido (interior), sem reverberação Tipo de Conteúdo: Leitura e diálogos conversacionais Dispositivos de Gravação: Smartphones Android e iPhone Origem: Portugal Língua: Português Características da Anotação: Transcrição ortográfica textual; Precisão de Anotação: Taxa de Precisão de Palavras (WAR) ≥97% |
| 20 Horas – Leitura e Fala Conversacional em Alemão via Telemóvel | Smartphones | 20 horas de áudio | Formato de Áudio: WAV não comprimido, 16 kHz, 16 bits, mono Condições de Gravação: Ruído ambiente reduzido (interior), sem eco Tipo de Conteúdo: Leitura e diálogos conversacionais Dispositivos de Gravação: Smartphones Android e iPhone Origem: Alemanha Língua: Alemão Características da Anotação: Transcrição textual completa Precisão de Anotação: Taxa de Precisão de Palavras (WAR) ≥97% |
| 20 Horas – Leitura e Fala Conversacional em Italiano via Telemóvel | Smartphones | 20 horas de áudio | Formato de Áudio: WAV não comprimido, 16 kHz, 16 bits, mono Condições de Gravação: Ruído ambiente reduzido (interior), sem eco Tipo de Conteúdo: Leitura e diálogos conversacionais Dispositivos de Gravação: Smartphones Android e iPhone Origem: Itália Língua: Italiano Características da Anotação: Transcrição textual completa Precisão de Anotação: Taxa de Precisão de Palavras (WAR) ≥97% |
| 20 Horas – Leitura e Fala Conversacional em Espanhol via Telemóvel | Smartphones | 20 horas de áudio | Formato de Áudio: WAV não comprimido, 16 kHz, 16 bits, mono Condições de Gravação: Ruído ambiente reduzido (interior), sem eco Tipo de Conteúdo: Leitura e diálogos conversacionais Dispositivos de Gravação: Smartphones Android e iPhone Origem: Espanha Língua: Espanhol Características da Anotação: Transcrição textual completa Precisão de Anotação: Taxa de Precisão de Palavras (WAR) ≥97% |
| 20 Horas – Leitura e Fala Conversacional em Português Europeu via Telemóvel | Smartphones | 20 horas de áudio | Formato de Áudio: WAV não comprimido, 16 kHz, 16 bits, mono Condições de Gravação: Ruído ambiente reduzido (interior), sem eco Tipo de Conteúdo: Leitura e diálogos conversacionais Dispositivos de Gravação: Smartphones Android e iPhone Origem: Portugal Língua: Português Características da Anotação: Transcrição textual completa Precisão de Anotação: Taxa de Precisão de Palavras (WAR) ≥97% |
| 20 Horas – Leitura e Fala Conversacional em Japonês via Telemóvel | Smartphones | 20 horas de áudio | Formato de Áudio: WAV não comprimido, 16 kHz, 16 bits, mono Condições de Gravação: Ruído ambiente reduzido (interior), sem eco Tipo de Conteúdo: Leitura e diálogos conversacionais Dispositivos de Gravação: Smartphones Android e iPhone Origem: Japão Língua: Japonês Características da Anotação: Transcrição textual completa Precisão de Anotação: Taxa de Precisão de Palavras (WAR) ≥97% |
| 20 Horas – Leitura e Fala Conversacional em Coreano via Telemóvel | Smartphones | 20 horas de áudio | Formato de Áudio: WAV não comprimido, 16 kHz, 16 bits, mono Condições de Gravação: Ruído ambiente reduzido (interior), sem eco Tipo de Conteúdo: Leitura e diálogos conversacionais Dispositivos de Gravação: Smartphones Android e iPhone Origem: Coreia do Sul Língua: Coreano Características da Anotação: Transcrição textual completa Precisão de Anotação: Taxa de Precisão de Palavras (WAR) ≥97% |
| 10 Horas – Leitura e Fala Conversacional em Pashto via Telemóvel | Telemóvel | 10 horas de áudio | Formato de Áudio: PCM com codificação A-law/μ-law, 8 kHz, 8 bits, mono Tipo de Conteúdo: Diálogos baseados em tópicos predefinidos Condições de Gravação: Ruído ambiente reduzido (interior) Dispositivos de Gravação: Smartphones Origem: Afeganistão Língua: Pashto (código ps-AF) Participantes: 224 locutores no total (92% do sexo masculino, 8% feminino) Características da Anotação: Transcrição textual, marca temporal, ID de locutor, género Precisão de Anotação: Taxa de Precisão de Palavras (WAR) ≥95% |
Note: Please apply for datasets reasonably according to the research field. The maximum number of applications for speech recognition datasets is 4 sets.