ヤマムギ

growing hard days.

*

Rapidminerハンズオン勉強会に行ってきました

      2016/09/18

機械学習 OSSのRapidminerの勉強会に行ってきました。

rapidmainer-768x474

OSS

BI

  • pentaho
  • jedox

DB

  • INFOBRIGHT

Bigdata

  • cloudera

data mining

  • rapidminer
  • nysol
    UNIXコマンドベースのデータマイニングツール
  • Revolution R(Microsoft R Server)
    BIGDATAの分析が出来る商用版のR

データマイニング(データ分析)

今まで知られていなかった役立つ可能性のある情報を抽出する
→データを分析してビジネスに使える知識を発見すること

※テキストデータはデータマイングの中でもテキストマイニングい分類される

テキストマイニング

nysolの文(Fumi)が形態素解析
文章から表形式の行列データを作る
品詞の出現回数で分類「見込み」、「見込めない」といった教師データモデルを作成してそれにあてはめれば予測は可能
デフォルトは一般的な単語データが適用されるので辞書データの作成は必要
nysolの文(Fumi)はJUMANを採用

ネットワーク分析

言葉と言葉のつながりを分析する

ETL(前処理)

Extract

外部の情報源からデータ抽出

Transformation

変換、加工

Load

ロード

分析

回帰分析

データから実数値を予測

クラス分類

データが属するカテゴリの予測

クラスタリング

データのグループ化
※過去の行動パターンが似ているユーザーなど

頻出パターン抽出

データから頻出する組み合わせを抽出

rapidminer

  • OSS
  • RapidMiner Studio Communuutiy Editionは無償
  • プログラミング無しに簡単に分析
  • 豊富な可視化ツール
  • 充実した分析機能
  • 拡張パッケージのインストールが可能
  • pythonのコードも書ける

ハンズオンメモ

  • missing_attributesで欠損データが確認できる
  • Annotationでname(列名)かcomment(コメントアウト)かが設定出来る
  • 136個の正常機械と故障機械の25のセンサー値
  • 予測とは過去のデータで作ったモデルに今のデータをあてはめる
  • ReferenceData 正解が分かっているデータ
  • New Data 正解を持たないデータ
  • k近傍法でk=1は使ってはならない
  • unlは unlabel data ラベルを持たないデータ
  • confidence 信頼係数 足すと1
  • RapidMinerブログ

列の役割

  • id 分析に使用しない、各行を識別するためだけの列
  • label 分類する項目、対象、目的変数
  • attribute 説明変数

質問メモといただいた回答

  • Studio以外のrapidminerについて教えてください。
    ServerはStudioの機能を共有出来る。
    Cloudはサーバーでクラウドが利用出来る。
    RadoopはHadoopと同じBigDataの分散処理が可能。
    無料のCommunityエディションがあるのはStudioのみで他は有償のEnterpriseエディション。
    Studioにも有償のEnterpriseエディションがあり実行のバッチ処理が可能。
    Studioの有償版は1ライセンス20万~30万ぐらい

  • 数値結果の予測チュートリアルは?
    まだだが線形回帰で近日公開する予定。

  • Databaseデータソースの種類は?
    JDBCで接続できるデータベースは問題なし

まとめ

課題がはっきりしないままスタートしても失敗する、というか意味がない。
ガートナー調査では日本企業でビッグデータ活用が出来ているのは6%。
48%はデータから価値を得る方法がわからない、課題設定が出来ていない。
ディープラーニングは画像、音声、テキストに強い。
数値ならば機械学習でも良い。


最後までお読みいただきましてありがとうございました!

「AWS認定資格試験テキスト&問題集 AWS認定ソリューションアーキテクト - プロフェッショナル 改訂第2版」という本を書きました。

「AWS認定資格試験テキスト AWS認定クラウドプラクティショナー 改訂第3版」という本を書きました。

「ポケットスタディ AWS認定 デベロッパーアソシエイト [DVA-C02対応] 」という本を書きました。

「要点整理から攻略するAWS認定ソリューションアーキテクト-アソシエイト」という本を書きました。

「AWSではじめるLinux入門ガイド」という本を書きました。

 - study ,

ad

ad

  関連記事

トラックボールユーザー集合!確実に何かが始まった日。

Logcool社のトラックボールマウス M570や他のトラックボールマウスを愛用 …

「雲勉 第1回【勉強会:新技術好き!】AWSマネージドサービス勉強会」に行ってきました

「雲勉 第1回【勉強会:新技術好き!】AWSマネージドサービス勉強会」に行ってき …

「XP祭り in 関西 2016 〜アジャイル15周年ふりかえり〜」に行ってきました

「XP祭り in 関西 2016 〜アジャイル15周年ふりかえり〜」に行ってきま …

Developers Summit 2024「徹底解剖!?JALインフォテック様が取り組む予兆検知/早期復旧を可能にするデータ分析/活用戦略とは?」を見ました

株式会社JALインフォテック サービス事業本部 IT基盤事業部 共通サービス基盤 …

Developers Summit 2024「AI時代のソフトウェアテストの現在と未来」を見ました

Launchable, Inc. Co-CEO 川口 耕介さん 和田 卓人 さん …

「Serverless Meetup Osaka #01:begin」に参加しました

2024/5/25に開催の「Serverless Meetup Osaka #0 …

ヤマムギ vol.9 (AWS)EC2からAWS CLIコマンドを実行してみようハンズオン 手順

このブログは2020/5/5に開催しました、「ヤマムギ vol.9 (AWS)E …

Developers Summit 2018 「「技術内閣制度」2年間やってきて得られた事とこれから ~開発チーム横断での技術課題解決、技術力強化、エンジニア文化醸成」を聞きました

以下は、思ったことや気になったことをメモしていますので、必ずしも登壇者の発表内容 …

交通情報系スキルを事例に見る日常生活に溶け込むスキルのテクニック(Alexa Day 2019でのブログ)

以下は、気になったことのメモとか感想を書いています。 登壇者、発表者、主催企業な …

「IoT縛りの勉強会/SIer主催版 SIerIoTLT vol4」に行ってきました

「IoT縛りの勉強会/SIer主催版 SIerIoTLT vol4」に行ってきま …