AWS Machine Learning Specialty - MLS-C01
Validates expertise in building, training, tuning, and deploying ML models on AWS
Tempo limite
2h 50m
Questões
65
Nota mínima
75%
Dificuldade
Avançado
Categoria
AWS Machine Learning Specialty
Questões de exemplo
Algumas questões deste simulado, com a resposta correta e o porquê dela.
1.Uma equipe precisa armazenar 40 TB de imagens de treinamento que jobs de treinamento do SageMaker leem repetidamente, com armazenamento durável, econômico e sem gerenciamento de servidores. Qual armazenamento devem usar?
- AAmazon S3Resposta correta
- BVolumes do Amazon EBS anexados às instâncias de treinamento
- CAmazon Redshift
- DAmazon EFS com modo de desempenho Max I/O
Por quê
O Amazon S3 é o repositório padrão de dados de treinamento do SageMaker: é durável, escala sem provisionamento, custa muito menos por gigabyte que armazenamento em bloco ou arquivo, e os jobs de treinamento do SageMaker leem dele nativamente em modo File ou Pipe. Volumes do EBS se anexam a uma única instância e precisam ser dimensionados previamente, o EFS é mais caro por gigabyte e é usado quando se exige semântica POSIX ou leituras repetidas de baixa latência, e o Redshift é um data warehouse para análise estruturada, não para armazenar imagens.
2.Vários jobs de treinamento e instâncias de notebook do SageMaker precisam ler o mesmo conjunto de dados simultaneamente por um sistema de arquivos POSIX com baixa latência de primeiro byte, e o conjunto é reutilizado em muitos experimentos. Qual armazenamento se encaixa melhor?
- AAmazon EFSResposta correta
- BAmazon EBS em modo Multi-Attach
- CAmazon DynamoDB
- DAmazon S3 Glacier Instant Retrieval
Por quê
O Amazon EFS fornece um sistema de arquivos POSIX compartilhado que muitas instâncias de treinamento e notebooks podem montar ao mesmo tempo, adequado a um conjunto ativamente reutilizado em que a latência de leitura por época importa. O S3 é o padrão mais barato, mas é armazenamento de objetos sem semântica POSIX, o EBS se anexa a uma instância por vez em modo de leitura e escrita, e o DynamoDB é um armazenamento chave-valor e não um sistema de arquivos.
3.Eventos de clickstream chegam continuamente e precisam aterrissar no Amazon S3 em formato Parquet com o mínimo de código, com buffer por tamanho ou tempo e sem aplicação consumidora a gerenciar. Qual serviço deve ser usado?
- AAmazon Data FirehoseResposta correta
- BAmazon Kinesis Data Streams com um consumidor personalizado
- CAmazon EMR com um job de streaming do Spark
- DAmazon Athena
Por quê
O Amazon Data Firehose é um stream de entrega totalmente gerenciado que faz buffer dos registros por tamanho ou intervalo, converte os registros para Parquet ou ORC usando um esquema de tabela do Glue e os grava no S3 sem nenhum código consumidor. O Kinesis Data Streams armazena registros mas exige uma aplicação consumidora para gravá-los, o EMR significaria gerenciar um cluster para uma tarefa de entrega, e o Athena consulta dados já no S3.
4.Um pipeline de streaming precisa reter registros por 24 horas para que duas aplicações consumidoras independentes leiam todo o fluxo em seu próprio ritmo, e uma delas possa reprocessar a partir de um ponto anterior. Qual serviço fornece isso?
- AAmazon Kinesis Data StreamsResposta correta
- BAmazon Data Firehose
- CFilas padrão do Amazon SQS
- DNotificações de evento do Amazon S3
Por quê
O Kinesis Data Streams armazena registros em shards por um período de retenção configurável e permite que vários consumidores independentes leiam os mesmos registros em seus próprios offsets, incluindo reprocessamento a partir de uma posição anterior. O Data Firehose entrega a um destino sem oferecer reprocessamento controlado pelo consumidor, o SQS exclui mensagens após confirmação de um consumidor, e o S3 é um destino e não um fluxo.
5.Uma equipe precisa executar ETL sem servidor que descubra o esquema de arquivos CSV brutos no S3, os catalogue e os transforme em Parquet particionado, sem cluster a gerenciar. Qual combinação devem usar?
- AUm crawler do AWS Glue mais um job de ETL do AWS GlueResposta correta
- BUm cluster do Amazon EMR executando Spark
- CAmazon Athena CREATE TABLE AS SELECT executado manualmente
- DAmazon Data Firehose com conversão de formato de registro
Por quê
Um crawler do AWS Glue popula o Data Catalog com o esquema descoberto, e um job de ETL do Glue escrito em PySpark lê a tabela do catálogo e grava Parquet particionado, tudo sem servidor. O EMR oferece a mesma capacidade Spark mas exige dimensionar e gerenciar o cluster, o Athena consulta dados sem transformá-los e gravá-los em um job gerenciado, e o Firehose entrega dados de streaming em vez de fazer ETL em lote.
Praticar todas as 65 questões
Perguntas frequentes
O simulado AWS Machine Learning Specialty - MLS-C01 é gratuito?
Você pode fazer usando as tentativas gratuitas da sua conta. Quando elas acabam, este simulado exige um plano premium, enquanto os simulados de nível fundamental seguem gratuitos e ilimitados.
Quantas questões tem e quanto tempo dura?
65 questões com limite de 170 minutos, para você praticar sob a mesma pressão de tempo da prova real.
Qual nota eu preciso para passar?
Você precisa de 75% para ser aprovado neste simulado. A nota e a revisão questão a questão aparecem assim que você termina.
Preciso criar uma conta?
Sim, uma conta gratuita. É ela que permite salvar sua tentativa, corrigir a prova e guardar seu histórico.
Posso refazer o simulado?
Pode. Cada tentativa consome uma das suas tentativas gratuitas, e o plano premium deixa as tentativas ilimitadas.
Estas são as questões reais da prova oficial?
Não. O NaHero não reproduz questões da prova oficial. São questões de prática escritas para reproduzir o formato, os temas e o nível de dificuldade dela.