Filtrar


Questões por página:
A respeito do Apache Hadoop, ecossistema muito usado no contexto de processamento de grandes volumes de dados, analise os itens a seguir.

I. O Hadoop MapReduce é um framework de software que facilita a criação de aplicações para processar vastas quantidades de dados (datasets de múltiplos terabytes) em paralelo, utilizando grandes clusters (milhares de nós) de hardware comum, de maneira confiável e tolerante a falhas.
II. O Hadoop Distributed File System (HDFS) é um sistema de arquivos distribuído, projetado para ser executado em hardware comum.
III. A ideia fundamental do YARN é dividir as funcionalidades de gerenciamento de recursos e o agendamento/monitoramento de tarefas em daemons distintos.

Está correto o que se afirma em
Em relação aos bancos de dados NoSQL orientados a documentos e às técnicas empregadas nesse tipo de NoSQL, analise as afirmativas a seguir e assinale (V) para a verdadeira e (F) para a falsa.

( ) A normalização dos dados é frequentemente utilizada, garantindo a consistência dos dados, escalabilidade e evitando redundância.
( ) Utilizam um modelo de dados flexível (schemaless), e empregam preferencialmente o armazenado de dados em formatos como PDF e TXT.
( ) São comumente mais escaláveis horizontalmente do que bancos de dados relacionais, permitindo dessa forma a distribuição de dados entre múltiplos servidores.

As afirmativas são, respectivamente,
No contexto dos sistemas computacionais modernos, especialmente em ambientes corporativos e distribuídos, diversos mecanismos são empregados para garantir integridade, desempenho, continuidade operacional e confiabilidade no processamento das informações. Sobre esse assunto, julgue as sentenças abaixo como VERDADEIRAS (V) ou FALSAS (F).
(__) O controle de concorrência constitui um dos pilares da integridade em sistemas computacionais multiusuários, especialmente em bancos de dados e ambientes distribuídos.
(__) O gerenciamento de desempenho envolve o monitoramento contínuo de métricas como tempo de resposta, throughput, consumo de CPU, memória, latência de rede e gargalos de entrada e saída, buscando otimizar a eficiência operacional dos sistemas.
(__) O gerenciamento de desempenho coordena acessos simultâneos aos mesmos recursos sem comprometer consistência, isolamento e confiabilidade das transações.
A sequência correta é:
Considerando os diferentes tipos de Sistemas de Controle de Versões descritos, qual das seguintes afirmações é verdadeira sobre os Sistemas de Controle de Versões Distribuídos (DVCS)?
Uma equipe de auditoria possui uma tabela de NF-e com mais de 1 bilhão de registros em um pyspark.sgl.DataFrame chamado df. A auditora deseja inspecionar apenas 1.000 registros localmente em seu notebook, usando funcionalidades avangadas de pandas para buscar inconsisténcias. Nesse cenário, a abordagem em PySpark mais apropriada para gerar esses registros em um pandas. DataFrame, minimizando o risco de estouro de memória no ambiente local é: