Non réclamé : Travaillez-vous chez Hive?
Hive Avis: 4.2/5 — Un choix judicieux
Hive est un outil de gestion de projet tout-en-un développé pour « aider les équipes à avancer plus vite » quelle que soit leur façon de travailler. Les fonctionnalités sont créées en fonction des demandes des utilisateurs et mises à jour chaque semaine, faisant de Hive la première plateforme logicielle démocratique au monde. Il est surtout connu pour ses capacités de gestion de projet, de gestion du temps, de collaboration d'équipe, d'automatisation et d'une gamme d'intégrations avec des logiciels tiers. Hive est gratuit pour les utilisateurs solo et avec des versions premium disponibles pour les équipes et les entreprises.
|
API
|
|
| Segment |
Petite entreprise
Marché intermédiaire
Entreprise
|
| Déploiement | Cloud / SaaS / Web, Mobile Android, Mobile iPad, Mobile iPhone |
| Assistance | 24h/7 et XNUMXj/XNUMX (représentant en direct), chat, e-mail/assistance, FAQ/forum, base de connaissances, assistance téléphonique |
| Formation | Documentation |
| Langues | Anglais |
Comparer Hive avec d’autres outils populaires dans la même catégorie.
Interface utilisateur fantastique et attrayante. Simple d'utilisation pour le suivi, l'attribution et la surveillance des projets. Hive m'aide à suivre tous nos projets et les personnes qui y sont associées.
Je n'ai encore rien à redire ; je suis satisfait de l'utilisation de Hive.
Gestion des projets et obtention des relevés de temps
Hive est la meilleure solution d'entrepôt de données open source. Facile à utiliser, elle dispose du langage de requêtes HiveQL, dont la syntaxe est identique à celle de SQL. Il est donc aisé d'écrire des requêtes Hive et d'obtenir des rapports et des informations exploitables. C'est la solution idéale pour l'analyse de données. De plus, elle s'intègre facilement avec Spark, Hadoop et le cloud.
La latence élevée constitue un inconvénient. Des améliorations devraient être apportées pour réduire la latence des requêtes complexes.
Nous aider à obtenir des informations et des rapports sur notre activité. Nous aider à analyser les données et à en tirer des conclusions pour améliorer notre entreprise.
L'avantage principal de Hive est qu'il permet d'écrire du code SQL pour le traitement et la gestion des données. Il permet également de partitionner et de distribuer les données entre les machines du cluster. On peut aussi choisir un moteur d'exécution comme Spark, Tez ou MapReduce lors de l'exécution sur Hive. Si vous traitez et analysez de gros volumes de données par lots, Hive est la solution idéale.
Il ne prend en charge que les données structurées et les mises à jour ne sont pas possibles. Il ne prend en charge que l'OLAP.
Nous gérons notre entrepôt de données à des fins analytiques avec Hive. Nous partitionnons et regroupons les tables en clusters pour optimiser le traitement parallèle et réduire les échanges de données, ce qui améliore la fluidité du traitement. Nous utilisons également Spark pour lire les tables Hive et ainsi accélérer les calculs.
Bonnes capacités d'interrogation des bases de données Hive et création de schémas aisée.
Il n'autorise pas la conversion des types de données, car cela entraînerait une perte de données.
Interrogation de bases de données Hive. Également HS2 et le metastore Hive donnent des résultats rapides
Schéma compatible avec tous les formats de fichiers HDFS. Téléchargement aisé des données. Un outil complet comparable à un logiciel de base de données comme Toad.
Les performances sont parfois très difficiles à exécuter, notamment pour les requêtes. L'interface graphique pourrait être améliorée avec des options plus conviviales.
Traitement des données pour les rapports réglementaires… maintien de la traçabilité
J'ai longtemps été un grand fan d'Impala, jusqu'à ce que je me heurte à des limitations insurmontables. Je travaille beaucoup avec des tableaux, et la simple possibilité d'utiliser `array_contains` dans Impala m'a convaincu de passer à Hive. De plus, nous progressons rapidement dans le développement d'une macro personnalisée pour Hive, qui nous permet d'effectuer des requêtes complexes sans que la vue latérale ne s'interrompe.
La création de session prend du temps et la vitesse est assez lente comparée à Impala.
Analyse de données complexes avec des tables contenant plusieurs milliards de lignes par partition
Il offre une grande flexibilité de configuration. De nombreuses options permettent de charger les données directement depuis le système de fichiers Linux ou HDFS. Vous pouvez créer des tables externes et gérées. Une fonctionnalité intéressante est la possibilité d'exécuter des commandes Bash depuis Hive.
Il ne peut pas être utilisé pour la diffusion de données en continu. La journalisation des erreurs peut être améliorée afin d'optimiser le suivi et la résolution des erreurs.
Il sert à transformer et traiter par lots des ensembles de données Big Data. Il peut gérer des téraoctets de données. La fonctionnalité de prédicat push a considérablement amélioré les performances des requêtes, et les développeurs n'ont plus à s'en soucier.
Hive est idéal pour la gestion des journaux dans les projets Big Data. Nous l'utilisons dans notre projet et il est particulièrement performant pour les jointures et les regroupements, opérations complexes et délicates avec MapReduce. Il propose de nombreux packages de fonctions définies par l'utilisateur (UDF) et il est très facile d'en ajouter de nouvelles. Nous avons également utilisé le bucketing et le clustering pour optimiser les requêtes. Le concept de tables externes et la possibilité de manipuler les données même après la suppression d'une table dans Hive sont vraiment impressionnants. De nombreux connecteurs sont disponibles pour différents logiciels.
Ce qui me déplaît, c'est la latence et la façon dont les données sont enregistrées. Lors de l'insertion de données, je dois attendre longtemps pour que quelques enregistrements soient traités. Le plan d'exécution du compilateur est encore très rudimentaire, car il n'optimise pas correctement les requêtes. Bien que la communauté travaille activement à améliorer ces points, je pense qu'il faudra du temps avant que Hive ne soit pleinement opérationnel.
Nous utilisons Hive principalement pour la sauvegarde de nos journaux. Cela nous permet de suivre les enregistrements insérés, ceux qui ont échoué et les relations entre eux. Nous utilisons Tableau pour l'analyse des données.
L'évolution des fonctionnalités, de la vitesse, etc., me donne la confiance stratégique dont j'ai besoin dans l'environnement SQL sur Hadoop.
À ce stade, tout repose sur Pint & Theories, c'est génial dans Hive 1.2
Tirer profit de masses de données structurées et non structurées.
1) Capacité à gérer des données à l'échelle du pétaoctet ; 2) Capacité à travailler avec un langage de requête proche de SQL ; 3) Capacité de lecture du schéma
1) La technologie d'optimisation est encore en développement.
1) Gestion de grands ensembles de données 2) Gestion d'ensembles de données semi-structurés et structurés avec le même outil
Sa syntaxe de type SQL la rend facile à utiliser
Sa dépendance à MapReduce le rend parfois très lent, même pour une tâche simple.
Exécuter des requêtes spécifiques sur des fichiers Hadoop
La possibilité de visualiser les données HDFS dans un format relationnel et de les interroger facilement via HiveQL
Le fait qu'il utilise MapReduce, que ce soit pour interroger une table existante ou effectuer une requête complexe, pose problème. Tez contribue à atténuer ce problème. De plus, l'impossibilité de supprimer ou de mettre à jour des données constitue un véritable inconvénient et oblige à recourir à d'autres services, comme HBase.
La possibilité d'utiliser Hive sur Hue est idéale. Nous développons une plateforme permettant aux data scientists (qui privilégient l'interface graphique au shell) d'effectuer des analyses ; l'absence de commande est donc un atout majeur.
Son utilisation est très simple car elle ressemble à celle du langage SQL pour interroger les données. À mes débuts, je n'avais aucune expérience avec Hive et, en une semaine à peine, j'étais capable d'interroger de gros volumes de données et d'effectuer des analyses. En un mois, je pouvais administrer les données et créer mes propres bases de données avec les données utiles.
Peu de fonctions sont implémentées dans Hive. Les fonctions de fenêtrage sont très utiles, mais insuffisantes… Modifier des données dans une table n’est pas si simple…
Analyser quotidiennement, toutes les heures, voire toutes les minutes, l'expérience utilisateur, le comportement des utilisateurs dans l'application ou le client Web, etc.
Hive est un projet Apache. C'est un logiciel d'entrepôt de données qui facilite l'interrogation et la gestion de grands ensembles de données stockés sur des systèmes distribués. Il permet d'effectuer facilement des opérations d'extraction, de transformation et de chargement de données (ETL). Parmi ses atouts, on peut citer : (1) un langage de requête simple, de type SQL, appelé HiveQL, qui permet aux utilisateurs familiarisés avec SQL d'interroger les données. Il diffère cependant légèrement de la norme SQL. Par exemple, HiveQL peut être étendu avec des fonctions scalaires personnalisées (UDF), des agrégations (UDAF) et des fonctions de table (UDTF). (2) Vous pouvez définir votre propre format de données en lecture ou en écriture, appelé Hive SerDe. (3) Hive peut être exécuté sur Hadoop et HDFS. Il offre une excellente scalabilité. Personnellement, j'utilise Hive principalement pour les requêtes ad hoc et les rapports. Pour les rapports de BI, Hive est idéal car il permet de réutiliser le code SQL utilisé pour les entrepôts de données traditionnels. Avec Hive Server 2, vous bénéficiez également d'une véritable prise en charge JDBC, ce qui vous permet de connecter vos outils de BI. De nombreuses fonctionnalités SQL supplémentaires, telles que les cubes, les cumuls, le fenêtrage, le décalage (lag, lead, etc.), sont ajoutées à Hive grâce à l'initiative Hortonworks Stinger. Hive génère également un code très compact, ce qui facilite grandement la lecture et le débogage.
Le code source est trop volumineux, ce qui complique sa maintenance et son support. De plus, le nombre d'options de configuration est excessif. Un simple coup d'œil au fichier HiveConf.java suffit à s'y perdre. Configurer ces options peut s'avérer complexe et entraîner des erreurs, voire une dégradation des performances des requêtes.
Nous développons Hive. Hive fait partie de notre produit.
Apache Hive est un outil basé sur Hadoop permettant d'analyser de grands ensembles de données non structurées. La plupart des outils de BI et de développement SQL peuvent se connecter à Hive aussi facilement qu'à n'importe quelle autre base de données.
Impossible d'annuler une requête en cours. L'optimisation des requêtes est complexe comparée aux SGBDR.
Nous devions analyser un vaste ensemble de données pour notre algorithme de prédiction. Initialement, nous utilisions un SGBDR, mais les performances étaient très lentes et les utilisateurs n'en étaient pas satisfaits. Nous l'avons remplacé par Hive et avons constaté une nette amélioration des performances.
HiveQL ressemble davantage à SQL et est très facile à apprendre.
ne fonctionne pas bien si vous souhaitez des requêtes à faible latence.
performances pour 1 To de données
Si vous connaissez SQL, vous maîtriserez Hive très rapidement. Il offre de nombreuses fonctionnalités similaires, sans pour autant utiliser SQL à proprement parler. La création de tables et l'écriture de requêtes sont simplifiées, ce qui vous permettra d'explorer vos données en profondeur.
Comme pour tous les outils Hadoop, il existe de nombreux paramètres à ajuster. Optimiser et peaufiner son installation Hive prend du temps.
Structurer des données non structurées. Une fois Hive choisi pour accomplir cette tâche, nous avons pu rapidement mettre nos données à la disposition de nos data scientists. L'adoption du concept de Big Data s'en est trouvée facilitée.
C’est exaltant de voir à quel point il facilite le travail, grâce à sa messagerie de groupe qui stimule la collaboration, à ses modèles de projet flexibles, aux informations et aux avis des clients qui aident à l’élaboration de la stratégie.
Il est important de noter que ce système est gourmand en ressources et nécessite une quantité importante de RAM, ce qui peut ralentir certaines applications intégrées. Ce problème doit être résolu.
L'analyse des données des flux de travail a permis de révéler comment le travail est réellement effectué, ce qui est nécessaire pour optimiser les opérations, la planification, l'affectation des ressources, et bien plus encore. Elle s'est avérée d'une grande aide pour que chacun soit performant et respecte les délais et les objectifs.
Hive propose des outils de planification de projet, notamment la possibilité de suivre l'avancement du projet et son calendrier, de créer et d'attribuer des tâches et de gérer les ressources.
Je n'ai rien contre Hive puisque c'est celui que j'utilise.
Il permet aux utilisateurs d'analyser de grandes quantités de données structurées et semi-structurées.
Hive est un outil précieux car il offre des interfaces pour l'analyse et l'interrogation de données massives (Big Data) aux organisations confrontées à d'énormes volumes de données à traiter. Basé sur Hadoop, il simplifie considérablement la création et le stockage de requêtes SQL.
Le principal inconvénient de l'utilisation de Hive est qu'il ne permet pas d'effectuer des requêtes en temps réel, et notamment des mises à jour au niveau des lignes, car la latence est assez élevée dans Hive.
Hive résout les problèmes de traitement et d'analyse des données massives pour moi et mon entreprise. Grâce aux fonctionnalités offertes par Hive, nous pouvons traiter et analyser d'énormes volumes de données. Le traitement parallèle qu'il permet le rend particulièrement rapide.
Formats de fichiers pour les optimisations, externes
ne peut pas analyser les données non structurées, et n'est guère plus rapide lorsqu'il s'agit d'opérations complexes sur de très grands volumes de données.
analyses ad hoc et analyses par lots sur le Big Data
La distribution et le traitement des données dans Hive sont excellents. Les fonctions DDL et DML de Hive sont supérieures à celles des bases de données SQL classiques. Hive est particulièrement reconnu pour sa robustesse face aux pannes.
L'affichage des données sur Hive est très lent. Le traitement des données est très lent, ce qui entraîne un retard dans l'affichage des résultats. De plus, la syntaxe est un peu plus complexe que celle du langage SQL classique.
La tolérance aux pannes est une fonctionnalité très utile pour le stockage des données. En cas de perte d'une base de données, aucune sauvegarde n'est créée et cette base de données peut être facilement récupérée intacte.
sa facilité d'utilisation et son interface sont optimales
Exécution de requêtes en mode lent de map-reduce
stocker de grandes quantités de données et les extraire par le biais de requêtes
Au contraire, si vous écrivez comme un SQL normal, vous pouvez le faire pendant des heures pour traiter. Mais c'est un peu différent du clavier SQL, en particulier, en l'utilisant principalement pour des requêtes et des relations ad hoc, c'est un logiciel d'armement de données qui facilite la consultation et la gestion de grands ensembles de dados résidant dans l'armement distribué
Le réglage de l'emploi est difficile et difficile à obtenir pour des consultations complexes, il y a aussi certains bugs, comme tous les détails qui sont destinés à un réducteur unique, ou qui peuvent retarder les résultats de la consultation. -> Certaines opérations SQL ne fonctionnent pas dans le cadre, comme les associations ne sont pas identiques, les données ne peuvent pas être actualisées, mais nous les réécrivons
Nous développons Hive pour les personnes qui s'occupent d'écrire en consultant SQL, et elles peuvent très bien utiliser Hive en utilisant Hadoop pour les fichiers armés dans HDFS. Activités du Dumping Site Données de streaming de Big Data, comme les journaux de données de Hive Nous développons Hive
- Interface conviviale - Clients multiples (CLI) - Débogage aisé grâce à des journaux détaillés - Amélioration continue du produit pour répondre aux besoins des développeurs de bases de données - Accès depuis plusieurs applications - Sécurité renforcée grâce à l'accès via Knox - Absence d'indexation - Prise en charge de plusieurs formats de fichiers - Architecture Tez
- Lacunes d'authentification - Problèmes de routage via Zookeeper - Outil moins abouti que les outils de base de données classiques
L'équipe BI aide tous les utilisateurs de l'entreprise à ingérer et à accéder aux données depuis Hadoop. La plupart des utilisateurs maîtrisent les outils SQL standard. Afin de déployer Hadoop à l'échelle de l'entreprise, nous formons tous les utilisateurs à Hive.
Prise en main facile. Exploite les connaissances SQL. Documentation pertinente. Requêtes rapides à écrire.
La documentation est lacunaire sur certains points, notamment concernant les formats de date et d'heure. Les requêtes sont lentes et échouent souvent.
Prétraitement pour le pipeline d'apprentissage automatique. Exécution de requêtes ad hoc sur les bases de données clients pour générer des synthèses de haut niveau.
Il est très convivial. Facile à installer et à utiliser. J'aime beaucoup son interface.
Je ne vois rien à redire. Mon expérience avec HIVE a été excellente et j'étais pleinement satisfait de toutes ses fonctionnalités, car il répondait à tous mes besoins.
Je travaillais sur un projet scolaire dans le cadre d'un cours sur le Big Data, et l'exécution de requêtes avec HIVE a considérablement simplifié l'ensemble du projet.
Hive possède une interface simple et intuitive et remplit parfaitement sa fonction.
Jusqu'à présent, Hive a répondu à toutes mes attentes, et même les a dépassées.
Je travaille sur un système Hadoop pour identifier les recruteurs qui envoient trop de spams aux membres.
La syntaxe de Hive est géniale ! Elle ressemble beaucoup à du SQL, ce qui la rend facile à utiliser. Tables externes, partitions, buckets, UDF : toutes ces fonctionnalités me plaisent. Le format de données ORC occupe moins d'espace et permet une récupération des données bien plus rapide. L'apprentissage semble plus simple car similaire à SQL, mais attention ! Il est essentiel de maîtriser toutes les fonctionnalités de Hive avant d'écrire une requête HQL complexe pour joindre des tables de plusieurs centaines de gigaoctets et récupérer les résultats. Sinon, si vous l'écrivez comme une requête SQL classique, le traitement peut prendre des heures. Hive est donc toujours plus performant lorsque vous configurez les paramètres d'optimisation avant d'exécuter vos scripts. De plus, la complexité de ses types de données rend Hive plus utile que d'autres SGBD.
Hive est comparativement plus lent que ses concurrents. Il est facile à utiliser, mais cela a un coût en termes de traitement. Si vous l'utilisez uniquement pour le traitement par lots, Hive convient parfaitement.
Générer des ensembles de données à partir de fichiers volumineux à des fins de reporting.
Il s'agit de performances utilisant le calcul distribué
Options limitées pour l'optimisation des performances des requêtes
Il est très performant pour les tâches liées à l'OLAP