ラベル データマイニング の投稿を表示しています。 すべての投稿を表示
ラベル データマイニング の投稿を表示しています。 すべての投稿を表示

追伸:データマイニングの方法論(DSSS)

前回投稿した3つの方法論の他に、日本の「データサイエンティスト協会」がまとめたものがあったので追加メモ。これはCRISP-DMなどを参考にしているとのことで、項目名はそのまま。

参考サイト

DSSS

データサイエンティストスキル標準(DSSS)の意。
CRISP-DMなどを参考にして「データサイエンティスト協会」がまとめたもの

  1. Business Understanding(ビジネス要件定義)

    ~現状把握/課題設定
    ~改善仮設/目標設定
  2. Data Understanding(データの理解)

    ~分析プラン
    ~データデザイン/コレクション
    ~関係性/意味の理解
  3. Data Preparation(データの準備)

    データの加工
  4. Modeling(モデル作成)

    ~手法、アルゴリズム、変数の選択
  5. Evaluation(モデル評価)

    ~精度、頑健性
    ~ビジネス目標からみた評価
  6. Deployment(改善施策の提案)

    効果検証/PDCA

データ分析の方法論を幾つか(CRISP-DMとSEMMAとKDD。ついでにKKD)

「データサイエンティスト養成読本」(技術評論社,2013)にデータマイニングのプロセスとしてタイトルの3つが紹介されていたのでメモ。

CRISP-DM

Cross Industry Standard Process for Data Mining(業界横断型データマイニング汎用プロセス)の略。
SPSSなどが参加するコンソーシアムで開発された方法論。
データ分析から問題解決まで、次のステージに分けて定義している。

  1. Business Understanding

    対象のビジネス全体を理解し、課題・目的を明らかにするステージ
  2. Data Understanding

    関係者からのヒアリングを含め、データの収集・理解をするステージ
  3. Data Preparation

    数理モデル構築のためのデータマート・DWHを構築するステージ
  4. Modeling

    仮説に基づいて数理モデルを構築するステージ
  5. Evaluation

    構築した数理モデルを評価するステージ
  6. Deployment

    評価した数理モデルに基づいて何らかの施策を行うステージ

SEMMA

[Sample Explore Modify Model Assess]の略。
SAS社によって開発された方法論。
データ分析から問題解決まで、次のステージに分けて定義している。

  1. Sample

    大量のデータから重要な情報を含む分析用データを取得するステージ
  2. Explore

    理解を深めるために未知の傾向や例外を探索するステージ
  3. Modify

    モデル選択を意識した、データの作成・選択・変換を行うステージ
  4. Model

    結果に繋がるデータ同士の関係性を得るための数理モデルを作成するステージ
  5. Assess

    結果を評価し、実行するステージ

KDD

データ分析を次の過程に分けて理解する。
この概念を紹介した文章のタイトル「Knowledge Discovery in Databases」(Fayyadら, 1996)にちなんでKDDと呼ばれている。

  1. Selection

  2. Preprocessing

  3. Transformation

  4. Data Mining

  5. Interpretation/Evaluation(解釈/評価)

その他:KKD

古来より使用されてきた方法論。
次のステージの全て、あるいはいずれかを用いて問題解決を目指す。

  1. Keiken(経験)

  2. Kan(勘)

  3. Dokyou(度胸)

D3.js + Google Map API でヒートマップ表示

1. はじめに

“JsonファイルのデータをD3.jsで読み込み、
GoogleMapにヒートマップとして配置する”


8/4の投稿(Google Map Apiで地図にデータを配置する初歩的なメモ)ではGoogleMapApiを用いてGoogleマップ上にピンやヒートマップを描画する方法をメモしました。今回はより実用的に、ヒートマップなどのデータをJsonファイルとして準備し、D3.jsで読込んで描画する処理をメモします。前回のコードと比較すると、最近各所で使われているD3.jsがデータのロードに限ればとてもシンプルに利用できることが分かると思います。

GoogleMapAPIを使用する際の制限などは前回同様。使用許諾を参照してください。


2. データ

次のデータを「heatdata.json」という名前でスクリプトと同じフォルダに配置します。前回スクリプト内で使用したJsonコードはエラーが出たため、変数名などをダブルクォーテーションで囲むなど修正しています。

ファイルを直接開く

3. 実際のコード

上記JsonデータをD3.jsを使用して読み込み、GoogleMap上にヒートマップを描画します。
(コードの説明はソースのコメントを参照してください)

デモを表示する

会社主催で機械学習の勉強会を開催しました。

昨日(08/06)、会社主催の「PHP機械学習フォーラム」第一回セミナー&LTセッションが行われました。

書籍やネットでは難解な数式が並ぶ機会学習のアルゴリズムについて平易に解説する内容で、来場者の方々からも好意的な感想を頂き、実りの多い会でした。


多くの参加者に恵まれました。


ベイジアンフィルタのアルゴリズムを平易に解説する内容でした。


前回の出版記念セミナーとは違い、参加者の多くが技術よりの方という印象で、セミナー後の懇親会でも「高額な自然言語処理システムを入れたけれど使いこなせなかった」「Pythonは気になるけれどこれで受注できるかというと難しい」など実際の利用シーンに近い話題やプログラム言語に関する情報を交換することができました。

会社が機械学習の書籍を出版しました

この度、私が勤務する「学びing株式会社」が機械学習の書籍を出版しました。

書籍名は「PHPによる機械学習入門」!これまでJavaやPythonなど固い言語やアカデミックなイメージの強い言語での実装例が多かった機械学習処理ですが、弊社自身での使用頻度が高いPHP言語での解説となっています。ベイジアンフィルタなどの基本的なアルゴリズムを一から実装しているためアカデミックなバックボーンがない読者の方でも抵抗なく機械学習処理が実装できる良書となっています。



「PHPによる機械学習入門」
著者:斉藤 常治 (著), 高橋 佑幸 (著)
出版:リックテレコム



感想:「現場ですぐ使える時系列データ分析」(横内大介/青木儀充)

データ分析のための書籍感想[001]


「現場ですぐ使える時系列データ分析」
著者:横内大介/青木儀充
出版:技術評論社

一言で言うと、”時系列分析≒以前の自分との相関は?”


2003年にグレンジャー教授とエングル教授がノーベル経済学賞を受賞して脚光を浴びた時系列分析を非常に分かり易く説明した書籍です。私は学術的な部分はまったく門外漢ですが、この書籍で取り上げられている数式は(おそらく意図的に)比較的簡易なものが中心なので、一般的な統計書の数式を読める方であればこの書籍のみで、時系列分析がどのような発想でデータを扱おうとしているかを把握することができます。もちろん実際は遥かに難しく深い分野と思いますが、少なくともそう思わせるほど説明が良くまとまっています。

前半が理論の説明で、後半はRを用いた適用例になっています。例は株の値動きの比較や銘柄の分類です。著者の一人が証券情報サービスの最大手Quick社の人間なので、読んでいて説得力があります。私が大学で勉強した心理系の統計学は複数群の比較が中心でしたので、この書籍で紹介されている時系列分析は興味があって読みましたが、この分野が初めての読者にも十分な難易度と満足度がある書籍です。付録としてRの説明にある程度ページを割いていますが、このあたりは少し冗長な印象があり、できれば適用例の方が良かったと感じました。