人に聞けない痔の悩み、これでスッキリ >>

ずっと思ってたんですが、標準偏差って、「平均からのズレ」ですよね?それはなんとなく分かるのですが、標準偏差が大きいと何がいえるんですか?公務員目指して勉強しているのですが、そこが分からず、悩んでいます。どなたか教えてください。

このQ&Aに関連する最新のQ&A

A 回答 (5件)

ヒストグラムというグラフの形式はご存じですよね。


例えば、横軸を身長として、身長150~151cmの人は何人、151~152cmは何人、というようなグラフです。
この手のグラフは、それが身長であれ試験の得点であれ、なぜか形が似ています。角を丸くした富士山みたいな形をしてます。
データのバラつきが小さいヒストグラムは、とがって細い富士山、バラつきが大きいと、低くて広がってる富士山に見えます。

標準偏差とは、その富士山の広がり具合を表すために考え出された物です。標準偏差が大きいとは、データのバラつきが大きい(富士山が低く広がってる)ことを意味します。

とんがった富士山でも、広がった富士山でも、
(平均値-標準偏差)と(平均値+標準偏差)の間には、全体のデータ個数のうち約70%が含まれます。
(平均値-標準偏差×2)と(平均値+標準偏差×2)の間には、全体のデータ個数のうち約95%が含まれます。
(平均値-標準偏差×3)と(平均値+標準偏差×3)の間には、全体のデータ個数のうち約99.7%が含まれます。

参考URL:http://homepage2.nifty.com/crop_shimane-u/kougi4 …
    • good
    • 47

標準偏差は「平均からのズレ」の程度を表す一つの指標です。

分布のレンジ(範囲)を表す指標の一つでもあります。一概に言えないのは母集団分布に依存するからなのですが、母集団がある程度正規分布に近いという前提がある場合は、だいたいデータのほとんどは平均から標準偏差の±3倍に収まっているという感覚です。これは偏差値の言葉に直せば、ほとんどすべての受験生は偏差値20から80に収まっているという意味と同じです。

たとえば平均が20で標準偏差が3であれば、ほとんど全員が11~29に収まっているという感じですし、平均が50で標準偏差が40なら、10~90にだいたいデータが収まっているという分けです。

ただし上でも注意しましたが、これはあくまでも目安でしかなく、データが正規分布から程遠い場合はここまで正確なことは一般には言えません。しかしながらたとえばチェビシェフの不等式を使って、標準偏差によってデータの散らばりがどの程度かをある程度制御できるのです。とにかく、標準偏差が大きければ大きいほどデータのばらつきが大きい、標準偏差が小さければデータはほとんど平均のすぐ近くにしかばらついていない、そういう風に思われればよいと思います。

それからこれは余談になりますが、平均からのずれを表す指標は標準偏差の他に平均偏差というものも使われたりします。これは各要素から平均を引いて絶対値を取ったもの(つまり平均との差の絶対値)の平均で定義されます。標準偏差が平均との差の二乗の平均(つまり分散)の平方根で定義されたのと比較すると、こちらの方が計算が易しそうに思えるかも知れませんが、実際は絶対値を外すという計算はなかなか面倒で、分散のルートの方が計算はかなり易しいことが多いです。そういうわけでこちらが「標準」偏差と呼ばれるようです。偏差という言葉そのものに「平均からのずれ」という意味が含まれているので、平均偏差っていうのはちょっと違和感あるかも知れないんですけれど、標準偏差を二乗平方根偏差って呼べば平均偏差との違いが分かりやすいかも知れませんね。
    • good
    • 20

こんな考え方はどうでしょう。



何かを測ります。長さでも重さでも構いません。
何度も測ると誤差が出ますが、その分布が広がっていたら精度が低い、分布が狭い値に集中していたら精度が高い(可能性がある)と考えられます。標準偏差が大きいと、信頼できないという訳です。

別の例としては、製品のばらつきを考えてみるとわかりやすいと思います。最近は重さのばらつきはあまりないと思いますが、ばらつきが多いのは問題ですね。ですから標準偏差は、必要な範囲で小さく抑えられているはずです。

計測では、本当はもっと別の誤差要素を含みますし(標準偏差が小さくても必ずしも精度が高いとは言えない)、製品管理でも現実には単純に標準偏差で制御される訳ではないとは思いますが、考え方として。

ガウス分布(正規分布)の一般的な話で、簡単すぎる例だったらごめんなさい。
    • good
    • 7

1様のご回答は標準偏差についてすごく正当な理解の仕方だと思えます.標準偏差や分散は個々のデータの平均値からのずれの平均を表してるの

で、私は、これは、一般的なノルム空間(距離空間までは難しいかも)上の概念にまで拡張できるような気がするんですが、今一よく分ってません.
    • good
    • 7

標準偏差は、分布の広がりをあらわします。



100人の生徒がいて、テストの成績が全員60点だったら、標準偏差は0です。
1点から100点まで1人ずついるなら、標準偏差は29です。
0点が50人、100点が50人なら、標準偏差は50です。

データの散らばりが大きいほど、標準偏差が大きくなります。
    • good
    • 22

このQ&Aに関連する人気のQ&A

お探しのQ&Aが見つからない時は、教えて!gooで質問しましょう!

このQ&Aを見た人が検索しているワード

このQ&Aと関連する良く見られている質問

Qエクセル STDEVとSTDEVPの違い

エクセルの統計関数で標準偏差を求める時、STDEVとSTDEVPがあります。両者の違いが良くわかりません。
宜しかったら、恐縮ですが、以下の具体例で、『噛み砕いて』教えて下さい。
(例)
セルA1~A13に1~13の数字を入力、平均値=7、STDEVでは3.89444、STDEVPでは3.741657となります。
また、平均値7と各数字の差を取り、それを2乗し、総和を取る(182)、これをデータの個数13で割る(14)、この平方根を取ると3.741657となります。
では、STDEVとSTDEVPの違いは何なのでしょうか?統計のことは疎く、お手数ですが、サルにもわかるようご教授頂きたく、お願い致します。

Aベストアンサー

データが母集団そのものからとったか、標本データかで違います。また母集団そのものだったとしても(例えばクラス全員というような)、その背景にさらならる母集団(例えば学年全体)を想定して比較するような時もありますので、その場合は標本となります。
で標本データの時はSTDEVを使って、母集団の時はSTDEVPをつかうことになります。
公式の違いは分母がn-1(STDEV)かn(STDEVP)かの違いしかありません。まぁ感覚的に理解するなら、分母がn-1になるということはそれだけ結果が大きくなるわけで、つまりそれだけのりしろを多くもって推測に当たるというようなことになります。
AとBの違いがあるかないかという推測をする時、通常は標本同士の検証になるわけですので、偏差を余裕をもってわざとちょっと大きめに見るということで、それだけ確証の度合いを上げるというわけです。

Q標準偏差について詳しい方お願いします

お世話になります。
標準偏差は平均からのばらつき・・とききますが、「標準偏差が大きい」「小さい」という、その目安がわかりません。

たとえば、50人の集団で平均年齢30歳、標準偏差1.2だったらどうでしょうか?

また、平均年齢が同じぐらいでも、標準偏差が1.0と10.0と違う2つの集団についていろんなデータを比べると、何か問題がありますか?

どちらかでもいいので、わかるかたがいましたらおねがいいたします。

Aベストアンサー

とりあえず、「標準偏差」の定義はURLを読んでいただくとして。

標準偏差は「分散」の平方根ですから、その集団の標準偏差が大きい
ということは、その集団のデータのばらつきが大きいということです。

とりあえず、以下の話は母集団が正規分布をするという仮定で行います。

仮に平均年齢が同じ30歳で、標準偏差が1の集団の場合、その集団には
28歳~32歳の人しかいない(95%程度の確率でその中にデータがある)
ということですし、標準偏差が10ならば35歳の人も結構フツーにその
中にいる(同じ確率では10~50歳になります)ということです。

逆に、例えばテストの点などを考えますと、同じ60点でも平均65点、
標準偏差5、の場合と平均70点、標準偏差10の場合では、どれだけ
違うか直接には比較出来ません。これらを「平均50、標準偏差10」
に換算して比較するのが「偏差値」の考え方です。
(上記の場合、どちらも同じ偏差値40になります)

ということで標準偏差は、ばらつきの度合いを平均値と同時にチェック
する時に使う値です。標準偏差の違う集団を直接に比較するかどうかは
その母集団の性質によって違いますよ。

参考URL:http://ja.wikipedia.org/wiki/%E6%A8%99%E6%BA%96%E5%81%8F%E5%B7%AE

とりあえず、「標準偏差」の定義はURLを読んでいただくとして。

標準偏差は「分散」の平方根ですから、その集団の標準偏差が大きい
ということは、その集団のデータのばらつきが大きいということです。

とりあえず、以下の話は母集団が正規分布をするという仮定で行います。

仮に平均年齢が同じ30歳で、標準偏差が1の集団の場合、その集団には
28歳~32歳の人しかいない(95%程度の確率でその中にデータがある)
ということですし、標準偏差が10ならば35歳の人も結構フツーにその
中にいる(同じ確率...続きを読む

Q標準偏差が小さすぎると何が問題?

受験業界には「標準偏差」という言葉があるそうです。

標準偏差は,その値が大きいと成績の分散度が大きく,その逆は逆だそうです。

学校(教員)が見た場合,自校の生徒=受験者の分散度合いは小さいほうがよさそうに思えるのですが(理解が生徒に均一に浸透している証),小さすぎると何が問題として挙げられるのでしょうか?

Aベストアンサー

 どうやら、ANo.4は的を外してるようです。「標準偏差が小さい」というのは学力の分布のことではなくて、専ら試験の性能に関するご質問なのですね?

 平均点が高いということは試験が易しすぎるということ。平均点が低いということは試験が難しすぎるということ。これはま、誰でも分かってる話です。

 さて、標準偏差がやたら小さい試験は、易しすぎる問題と難しすぎる問題だけでできている(問1.1+1=? 問2.フェルマーの最終定理を証明せよ)に違いありません。実力の違いを測っていない試験だということであり、標準偏差が小さいのは適切な試験ではない。
 じゃあ、標準偏差が大きければいいのか。問題数が少なくて、しかも運に頼るしかないような試験(問1.コインをトスして表か裏かを選べ。どっちかが正解である。)であっても、標準偏差が大きくなります。たとえば、運に頼るしかない2択問題を10個並べれば、成績は平均が50点、標準偏差が15点ぐらいの正規分布になります(大数の法則)。
 なので、成績の分布が綺麗だからと言って、それだけじゃ試験が妥当な(実力を測っている)ものだとは言えない。

 結果を使って受験者を分別する側からすれば、リクツの上では、得点の分布が一様分布になるのが理想的(最も分解能が高い)と言えましょう。さらに得点が学力を反映していることが望ましい。
 すると、各受験者の「学力」が1個の数値xで代表できるようなものであると仮定すれば(データを見ると、この仮定は残念ながらかなり真実に近いのですが)、xの分布を一様分布に写像するような試験が理想的ということです。そういう試験は
(1) 運で答を当てるということは滅多にできず(選択式の問題でこれを実現するには、同じレベルの問題をいくつも並べておけば良いのです)、
(2) 問題数はとても多く、
(3) ごく易しい問題からかなり難しい問題まで揃っていて、
(4) うんと難しい問題や、うんと易しい問題に比べ、中間の難しさの問題の個数が多い。
(5) 試験時間は十分に余裕があって、早く解けるかどうかは成績にあまり関係ない。
という特徴を持つでしょう。

 どうやら、ANo.4は的を外してるようです。「標準偏差が小さい」というのは学力の分布のことではなくて、専ら試験の性能に関するご質問なのですね?

 平均点が高いということは試験が易しすぎるということ。平均点が低いということは試験が難しすぎるということ。これはま、誰でも分かってる話です。

 さて、標準偏差がやたら小さい試験は、易しすぎる問題と難しすぎる問題だけでできている(問1.1+1=? 問2.フェルマーの最終定理を証明せよ)に違いありません。実力の違いを測っていない試験だという...続きを読む

Q標準偏差に「通常の範囲」はありますか?(初心者の質問です)

現在、仕事で必要のため大変困っています。

大量のデータ(物件の見積金額)のばらつきを出すために「STDEVP」関数を用いて「標準偏差」を出しました。
この標準偏差というのは、よくある「山のようなグラフ」(すみません、名前がわかりません)の平均からどれだけ離れているか・・・ということをみるものでよかったでしょうか?

また、この標準偏差に「通常の範囲」というのはありますか?たとえば「マイナス」にはならないとか100以上の数値はない・・・など

そしてこのデータを「山のようなグラフ」にして見た目にすぐにわかるようにしたいのですが、どのようにしたら良いですか?

くだらないご質問だとはお思いでしょうが、なんとかお力を貸してください。

Aベストアンサー

>よくある「山のようなグラフ」
●正規分布グラフのことでしょう。
●標準偏差は、1峰の山型分布に限らず、平均を出せるデータがあれば(また平均はどんな場合でも出せますから)
(データ-平均)の2乗を全てのデータに亘って加えた
(Σ)もの(分散)から計算するからです。その平方根(+の方を採る約束)です。(不偏分散に付いては略)
●正規分布かそれに近い分布でないと、「もの」(推論)が言えないだけです。(例えば「平均値 ± 1 標準偏差の範囲内には全データの 68.27% が含まれる」など)
誤差に関係するようなものは使えます。正規分布以外の分布は沢山あります。むしろ正規分布が特殊でしょう。
>この標準偏差に「通常の範囲」というのはありますか
プラス値であることだけです。値について、1より小とかの原理的範囲はありません。公式から判ります。データが2個しかないと仮定して、仮定で平均を決め、平均+α、平均-αのαの値を大きくすればいくらでも「分散」値は大きくなることで判ります。
>そしてこのデータを「山のようなグラフ」にして
現実データの現実分布の形によるのです。無理に山のような形に出来るものでもなく、して良いものでもありません。
現実の分布の形が「まずありき」であって、現実をモデル
分布に強引に当てはめては、本末顛倒です。
経験的に理論的に正規分布をするはずのものが、そうなっていない時には、QC活動でおなじみの、何か外因的作用(機械の故障)や何かの要因が加わっていると、疑うわけです。試験成績であれば、あるクラスではその出題関連単元を教え、他のクラスでは教えなかったとか、カンニングが行われたのではないか、問題があまりにも易しすぎたのではないかなど。
パチンコの例の解説がありました。
http://www.yi-web.com/~ps/java/kakuritu_syoho11.htm
http://www.yi-web.com/~ps/
小生はダメですが、この方面に興味があれば理解のキッカケが掴めるかも。

>よくある「山のようなグラフ」
●正規分布グラフのことでしょう。
●標準偏差は、1峰の山型分布に限らず、平均を出せるデータがあれば(また平均はどんな場合でも出せますから)
(データ-平均)の2乗を全てのデータに亘って加えた
(Σ)もの(分散)から計算するからです。その平方根(+の方を採る約束)です。(不偏分散に付いては略)
●正規分布かそれに近い分布でないと、「もの」(推論)が言えないだけです。(例えば「平均値 ± 1 標準偏差の範囲内には全データの 68.27% が含まれる」など)
誤差...続きを読む

Q統計学的に信頼できるサンプル数って?

統計の「と」の字も理解していない者ですが、
よく「統計学的に信頼できるサンプル数」っていいますよね。

あれって「この統計を調べたいときはこれぐらいのサンプル数があれば信頼できる」という決まりがあるものなのでしょうか?
また、その標本数はどのように算定され、どのような評価基準をもって客観的に信頼できると判断できるのでしょうか?
たとえば、99人の専門家が信頼できると言い、1人がまだこの数では信頼できないと言った場合は信頼できるサンプル数と言えるのでしょうか?

わかりやすく教えていただけると幸いです。

Aベストアンサー

> この統計を調べたいときはこれぐらいのサンプル数があれば信頼できる・・・
 調べたいどの集団でも、ある一定数以上なら信頼できるというような決まりはありません。
 何かサンプルを集め、それをなんかの傾向があるかどうかという仮説を検証するために統計学的検定を行って、仮設が否定されるかされないかを調べる中で、どの検定方法を使うかで、最低限必要なサンプル数というのはあります。また、集めたサンプルを何か基準とすべき別のサンプルと比べる検定して、基準のサンプルと統計上差を出すに必要なサンプル数は、比べる検定手法により計算できるものもあります。
 最低限必要なサンプル数ということでは、例えば、ある集団から、ある条件で抽出したサンプルと、条件付けをしないで抽出したサンプル(比べるための基準となるサンプル)を比較するときに、そのサンプルの分布が正規分布(正規分布解説:身長を5cmきざみでグループ分けし、低いグループから順に並べたときに、日本人男子の身長なら170cm前後のグループの人数が最も多く、それよりも高い人のグループと低い人のグループの人数は、170cmのグループから離れるほど人数が減ってくるような集団の分布様式)でない分布形態で、しかし分布の形は双方とも同じような場合「Wilcoxon符号順位検定」という検定手法で検定することができますが、この検定手法は、サンプルデータに同じ値を含まずに最低6つのサンプル数が必要になります。それ以下では、いくらデータに差があるように見えても検定で差を検出できません。
 また、統計上差を出すのに必要なサンプル数の例では、A国とB国のそれぞれの成人男子の身長サンプルがともに正規分布、または正規分布と仮定した場合に「t検定」という検定手法で検定することができますが、このときにはその分布を差がないのにあると間違える確率と、差があるのにないと間違える確率の許容値を自分で決めた上で、そのサンプルの分布の値のばらつき具合から、計算して求めることができます。ただし、その計算は、現実に集めたそれぞれのサンプル間で生じた平均値の差や分布のばらつき具合(分散値)、どのくらいの程度で判定を間違える可能性がどこまで許されるかなどの条件から、サンプル間で差があると認められるために必要なサンプル数ですから、まったく同じデータを集めた場合でない限り、計算上算出された(差を出すために)必要なサンプル数だけサンプルデータを集めれば、差があると判定されます(すなわち、サンプルを無制限に集めることができれば、だいたい差が出るという判定となる)。よって、集めるサンプルの種類により、計算上出された(差を出すために)必要なサンプル数が現実的に妥当なものか、そうでないのかを、最終的には人間が判断することになります。

 具体的に例示してみましょう。
 ある集団からランダムに集めたデータが15,12,18,12,22,13,21,12,17,15,19、もう一方のデータが22,21,25,24,24,18,18,26,21,27,25としましょう。一見すると後者のほうが値が大きく、前者と差があるように見えます。そこで、差を検定するために、t検定を行います。結果として計算上差があり、前者と後者は計算上差がないのにあると間違えて判断する可能性の許容値(有意確率)何%の確率で差があるといえます。常識的に考えても、これだけのサンプル数で差があると計算されたのだから、差があると判断しても差し支えないだろうと判断できます。
 ちなみにこの場合の差が出るための必要サンプル数は、有意確率5%、検出力0.8とした場合に5.7299、つまりそれぞれの集団で6つ以上サンプルを集めれば、差を出せるのです。一方、サンプルが、15,12,18,12,21,20,21,25,24,19の集団と、22,21125,24,24,15,12,18,12,22の集団ではどうでしょう。有意確率5%で差があるとはいえない結果になります。この場合に、このサンプルの分布様式で拾い出して差を出すために必要なサンプル数は551.33となり、552個もサンプルを抽出しないと差が出ないことになります。この計算上の必要サンプル数がこのくらい調査しないといけないものならば、必要サンプル数以上のサンプルを集めて調べなければなりませんし、これだけの数を集める必要がない、もしくは集めることが困難な場合は差があるとはいえないという判断をすることになるかと思います。

 一方、支持率調査や視聴率調査などの場合、比べるべき基準の対象がありません。その場合は、サンプル数が少ないレベルで予備調査を行い、さらにもう少しサンプル数を増やして予備調査を行いを何回か繰り返し、それぞれの調査でサンプルの分布形やその他検討するべき指数を計算し、これ以上集計をとってもデータのばらつきや変化が許容範囲(小数点何桁レベルの誤差)に納まるようなサンプル数を算出していると考えます。テレビ視聴率調査は関東では300件のサンプル数程度と聞いていますが、調査会社ではサンプルのとり方がなるべく関東在住の家庭構成と年齢層、性別などの割合が同じになるように、また、サンプルをとる地域の人口分布が同じ割合になるようにサンプル抽出条件を整えた上で、ランダムに抽出しているため、数千万人いる関東の本当の視聴率を割合反映して出しているそうです。これはすでに必要サンプル数の割り出し方がノウハウとして知られていますが、未知の調査項目では必要サンプル数を導き出すためには試行錯誤で適切と判断できる数をひたすら調査するしかないかと思います。

> どのような評価基準をもって客観的に信頼できると判断・・・
 例えば、工場で作られるネジの直径などは、まったくばらつきなくぴったり想定した直径のネジを作ることはきわめて困難です。多少の大きさのばらつきが生じてしまいます。1mm違っても規格外品となります。工場では企画外品をなるべく出さないように、統計を取って、ネジの直径のばらつき具合を調べ、製造工程をチェックして、不良品の出る確率を下げようとします。しかし、製品をすべて調べるわけにはいきません。そこで、調べるのに最低限必要なサンプル数を調査と計算を重ねてチェックしていきます。
 一方、農場で生産されたネギの直径は、1mmくらいの差ならほぼ同じロットとして扱われます。また、農産物は年や品種の違いにより生育に差が出やすく、そもそも規格はネジに比べて相当ばらつき具合の許容範囲が広くなっています。ネジに対してネギのような検査を行っていたのでは信頼性が損なわれます。
 そもそも、統計学的検定は客観的判断基準の一指針ではあっても絶対的な評価になりません。あくまでも最終的に判断するのは人間であって、それも、サンプルの質や検証する精度によって、必要サンプルは変わるのです。

 あと、お礼の欄にあった専門家:統計学者とありましたが、統計学者が指摘できるのはあくまでもそのサンプルに対して適切な検定を使って正しい計算を行ったかだけで、たとえ適切な検定手法で導き出された結果であっても、それが妥当か否か判断することは難しいと思います。そのサンプルが、何を示し、何を解き明かし、何に利用されるかで信頼度は変化するからです。
 ただ、経験則上指標的なものはあります。正規分布を示すサンプルなら、20~30のサンプル数があれば検定上差し支えない(それ以下でも問題ない場合もある)とか、正規分布でないサンプルは最低6~8のサンプル数が必要とか、厳密さを要求される調査であれば50くらいのサンプル数が必要であろうとかです。でも、あくまでも指標です。

> この統計を調べたいときはこれぐらいのサンプル数があれば信頼できる・・・
 調べたいどの集団でも、ある一定数以上なら信頼できるというような決まりはありません。
 何かサンプルを集め、それをなんかの傾向があるかどうかという仮説を検証するために統計学的検定を行って、仮設が否定されるかされないかを調べる中で、どの検定方法を使うかで、最低限必要なサンプル数というのはあります。また、集めたサンプルを何か基準とすべき別のサンプルと比べる検定して、基準のサンプルと統計上差を出すに必要な...続きを読む

Qエクセルで計算すると2.43E-19などと表示される。Eとは何ですか?

よろしくお願いします。
エクセルの回帰分析をすると有意水準で2.43E-19などと表示されますが
Eとは何でしょうか?

また、回帰分析の数字の意味が良く分からないのですが、
皆さんは独学されましたか?それとも講座などをうけたのでしょうか?

回帰分析でR2(決定係数)しかみていないのですが
どうすれば回帰分析が分かるようになるのでしょうか?
本を読んだのですがいまいち難しくて分かりません。
教えてください。
よろしくお願いします。

Aベストアンサー

★回答
・最初に『回帰分析』をここで説明するのは少し大変なので『E』のみ説明します。
・回答者 No.1 ~ No.3 さんと同じく『指数表記』の『Exponent』ですよ。
・『指数』って分かりますか?
・10→1.0E+1(1.0×10の1乗)→×10倍
・100→1.0E+2(1.0×10の2乗)→×100倍
・1000→1.0E+3(1.0×10の3乗)→×1000倍
・0.1→1.0E-1(1.0×1/10の1乗)→×1/10倍→÷10
・0.01→1.0E-2(1.0×1/10の2乗)→×1/100倍→÷100
・0.001→1.0E-3(1.0×1/10の3乗)→×1/1000倍→÷1000
・になります。ようするに 10 を n 乗すると元の数字になるための指数表記のことですよ。
・よって、『2.43E-19』とは?
 2.43×1/(10の19乗)で、
 2.43×1/10000000000000000000となり、
 2.43×0.0000000000000000001だから、
 0.000000000000000000243という数値を意味します。

補足:
・E+数値は 10、100、1000 という大きい数を表します。
・E-数値は 0.1、0.01、0.001 という小さい数を表します。
・数学では『2.43×10』の次に、小さい数字で上に『19』と表示します。→http://ja.wikipedia.org/wiki/%E6%8C%87%E6%95%B0%E8%A1%A8%E8%A8%98
・最後に『回帰分析』とは何?下の『参考URL』をどうぞ。→『数学』カテゴリで質問してみては?

参考URL:http://ja.wikipedia.org/wiki/%E5%9B%9E%E5%B8%B0%E5%88%86%E6%9E%90

★回答
・最初に『回帰分析』をここで説明するのは少し大変なので『E』のみ説明します。
・回答者 No.1 ~ No.3 さんと同じく『指数表記』の『Exponent』ですよ。
・『指数』って分かりますか?
・10→1.0E+1(1.0×10の1乗)→×10倍
・100→1.0E+2(1.0×10の2乗)→×100倍
・1000→1.0E+3(1.0×10の3乗)→×1000倍
・0.1→1.0E-1(1.0×1/10の1乗)→×1/10倍→÷10
・0.01→1.0E-2(1.0×1/10の2乗)→×1/100倍→÷100
・0.001→1.0E-3(1.0×1/10の3乗)→×1/1000倍→÷1000
・になります。ようするに 10 を n 乗すると元の数字になるた...続きを読む

Q3σについて教えてください(基本的なこと)

文系出身なので、基本的なことが分かっていませんが、仕事の資料で出てきたので教えてください。
3σとは標準偏差で、規格を外れる確率が99.7%? など、少し調べたのですが、まだまだ分かりません。

例)
取引先の製品の、あるパラメータ(寸法)のロット内ばらつきを示す資料に、N=20個 規格6.0mm±0.3mm AVE.5.983で、3σ0.021というものありました。
※数値はうろ覚えです・・・
質問)
AVE.は20個測定した平均が、5.983mmだったということはもちろん分かるのですが、3σの0.021とはどう理解すればよいのでしょうか。
6.00mmに対して、0.021mm以上ずれる確率が0.03%と思えばよいのでしょうか?それともAVE.に対して0.021mmずれる確率???
そもそも0.021の単位は?(mm?)
はてなばかりですみません。初歩的な質問ですみませんが、例を挙げて分かりやすく教えていただけたら幸いです。

Aベストアンサー

> N=20個 規格6.0mm±0.3mm AVE.5.983で、3σ0.021

を普通に読むと、規格6.0mm(±0.3mm) で 20 個製造して検査したところ、平均値は 5.983 で標準偏差は 0.007mm (=0.021÷3) であった、という意味になります。標準偏差の単位は、標準偏差は「平均からのずれ」の平均ですから、平均値と同じになります。

この工程での真の平均値をμとしますと、今回の 20 個製造して得られた平均値 X=5.983 の標準偏差は 0.00157 (=0.007/√20) 程になります。これは、μは 99.7 %の確率で 5.983±(3×0.00157) にあることを示しています。
ここから、真の平均μが 6mm であったならば 0.3% 以下しか起こらないような珍しいことが起こっているという意味で「統計的に有意な差がある」といい、真の平均は6mmではない、と結論づけることが出来ます。

それから、製品一つ一つについては、平均 5.983±0.021 に入らない確率は 0.03 %になります。
何れにせよ、99.7%は規格の範囲内に入っていることになりますね。

> N=20個 規格6.0mm±0.3mm AVE.5.983で、3σ0.021

を普通に読むと、規格6.0mm(±0.3mm) で 20 個製造して検査したところ、平均値は 5.983 で標準偏差は 0.007mm (=0.021÷3) であった、という意味になります。標準偏差の単位は、標準偏差は「平均からのずれ」の平均ですから、平均値と同じになります。

この工程での真の平均値をμとしますと、今回の 20 個製造して得られた平均値 X=5.983 の標準偏差は 0.00157 (=0.007/√20) 程になります。これは、μは 99.7 %の確率で 5.983±(3×0.00157) にあることを示...続きを読む

Q相関係数についてくるP値とは何ですか?

相関係数についてくるP値の意味がわかりません。

r=0.90 (P<0.001)

P=0.05で相関がない

という表現は何を意味しているのでしょうか?
またMS Excelを使ってのP値の計算方法を教えてください。

よろしくお願い致します。

Aベストアンサー

pは確率(probability)のpです。全く相関のない数字を組み合わせたときにそのr値が出る確率をあらわしています。

統計・確率には100%言い切れることはまずありません。というか100%言い切れるのなら統計・確率を使う必要は有りません。
例えばサイコロを5回振って全て同じ目が出る確率は0.08%です。そんな時、そのサイコロを不良品(イカサマ?)と結論つけるとわずかに間違っている可能性が残っています。ただ、それが5%以下ならp=0.05でそのサイコロは正常ではないと結論付けます。
それが危険率です。(この場合はp=0.1%でもいいと思いますが)
相関係数においても相関の有無を結論つけるにはそのrが偶然出る確率を出すか、5%の確率ならrがどれぐらいの値が出るかを知っておく必要が有ります。

>r=0.90 (P<0.001)

相関係数は0.90と計算された。相関がないのに偶然r=0.90 となる確率は0.001以下だと言ってます。

>P=0.05で相関がない

相関がないと結論。(間違っている確率は5%以下)だと言ってます。

エクセルでの計算ですが、まず関数CORRELを使ってr値を出します。xデータがA1からA10に、yデータがB1からB10に入っているとして

r=CORREL(A1:A10,B1:B10)

次にそのr値をt値に変換します。

t=r*(n-2)^0.5/(1-r^2)^0.5

ここでnは組みデータの数です。((x1,y1),(x2,y2),・・・(xn,yn))
最後に関数TDISTで確率に変換します。両側です。

p=TDIST(t値,n-2,2)

もっと簡単な方法があるかも知れませんが、私ならこう計算します。(アドインの分析ツールを使う以外は)

pは確率(probability)のpです。全く相関のない数字を組み合わせたときにそのr値が出る確率をあらわしています。

統計・確率には100%言い切れることはまずありません。というか100%言い切れるのなら統計・確率を使う必要は有りません。
例えばサイコロを5回振って全て同じ目が出る確率は0.08%です。そんな時、そのサイコロを不良品(イカサマ?)と結論つけるとわずかに間違っている可能性が残っています。ただ、それが5%以下ならp=0.05でそのサイコロは正常ではないと結論付けます。
それが危険率です。(この場...続きを読む

Q標準偏差と平均偏差の違い

標準偏差と平均偏差は、数字としての意味は何が違うのでしょうか。(算出方法の違いなどは分かります)
換言すれば、平均偏差でもサンプルのばらつきが表現できるのに、わざわざ計算過程をややこしくして標準偏差を求めることにどのようなメリットがあるのかということです。

『数種類の検体を用いて同一行程の実験を行い、その結果の値の揺れ(ばらつき)を求めたい』

このレポートへのアプローチとして、平均偏差または標準偏差を利用するとき、両者が意味的にどのような違いをもつのか、ご教授ください。

Aベストアンサー

ばらつきの大きさを比較したいなら、どちらでも同じでしょう。

違いを考えるには、平均とは何か?ということが鍵になります。サンプルの平均は m=(x1+...+xn)÷n で求めるのが通例ですが、なぜこうするのがよいか?を考えてみてください。

実は、このようにして求める平均は、標準偏差の2乗和を最小にします。
では、平均偏差を最小にするような値を計算してみましょう。つまり、
  J= |x1-μ|+...+|xn-μ| を最小にするμを求めるわけです。
例えば、データが(1,1,1,0,-3)だったとします。
m=0 となりますが、(2)式を最小にする値は、0ではありませんね。
一方で,標準偏差の2乗和
 V= (x1-μ)^2+...+(xn-μ)^2
を最小にするμはVをμで微分して=0と置いて、とけば
 μ=m であることがわかります。
平均偏差を最小にする値は中央値ですので、そこが違うということになるわけです。

Q3σ法による計算式

当方、管理や統計学など全く無知ですのでわかりやすく教えて下さい。

仕事で、管理図を作成するにあたり、3σ法で管理限界線(UCL,LCL)を計算せよとの事を言われましたが、理解出来てません。

3σ法の公式とかあるんでしょうか?あったら教えて下さい。あと、3σとは何か、簡単に教えて下さい

Aベストアンサー

まず、3σというのは、σの3倍のことです。
そして、σというのが、「標準偏差」といわれるもので、これはばらつきの大きさを表すものです。

計算方法などは、
http://www.mbanavi.com/school/stat04.htm
最近では、excel で計算してしまうという手もあります。(が、それでは意味がつかみにくいかも)
基本的には、
1)全体の平均をとる
2)個々のデータと平均との差を求める(この大小がばらつきに相当)
3) 2)でとった個々のデータについての差を2乗する(プラス・マイナスの影響をなくすため)
4)それを、(データの数-1)で割る(気持ちとしては、ばらつきの量を平均した感じ・データの数-1で割るのは、「母標準偏差の推定」という考え方があるから)
5) 3)でばらつきを2乗しているので、それをルートで開いて元に戻す

とうことになります。

統計上いくつかの前提があって、例えば、製造工程で普通にものを作った場合、いろいろなばらつきは、それぞれ独立に出ます。
そこで、結果的には、ある一定の平均値付近のものが多くでき、平均値から外れたものは、少しだけどできるという形になる場合が多いのです。
この場合、誤差が本当の意味での「ばらつき」であれば、これは、「正規分布」という分布(つまり、平均値付近が多く、それから離れると少なくなっていくような)をします。

この「正規分布に従う」という前提で、平均値±3σの間には、全体の、99%強 が含まれるというのが、統計的に知られています。
これを以て、3σで管理という事になります。


さて、「管理図」ということですが、いろいろな種類のものがあります。
そこで、普通は、UCL, LCL は、製品自体の規格値(か、それから算出された値)を使うので、直接、3σは出てこない気がするのですが。
考えられるのは、x-s (平均と、標準偏差の管理図)で、標準偏差に対する上限管理値が3σなのかなと。(この場合、下限の管理値はありません。0が理想なので)

まず、3σというのは、σの3倍のことです。
そして、σというのが、「標準偏差」といわれるもので、これはばらつきの大きさを表すものです。

計算方法などは、
http://www.mbanavi.com/school/stat04.htm
最近では、excel で計算してしまうという手もあります。(が、それでは意味がつかみにくいかも)
基本的には、
1)全体の平均をとる
2)個々のデータと平均との差を求める(この大小がばらつきに相当)
3) 2)でとった個々のデータについての差を2乗する(プラス・マイナスの影響をなくすため...続きを読む


人気Q&Aランキング