【先着1,000名様!】1,000円分をプレゼント!

実験などの測定値が正規分布する理由はなんでしょうか?
インターネットで調べてみたのですが、やり方が悪いのか
解りやすい説明にたどりつけません…
なるべく、言葉で説明していただきたいのですが、
どうかよろしくお願いいたします!

A 回答 (3件)

>実験などの測定値が


これは.前提時用件があるのです。
1.「連続している値」を測定する。不連続な1.2.3....と数える内容ではない。
2.ある特定の値が変動せずに存在し.この値を測定するときに発生する誤差は.偶然誤差(名称疑問)による
「変動する測定値」.一例としては.日の出から日の入りまでの時間
偶然誤差以外の誤差としては.わざと隣のメモリを読む・わざと.温度を変えて長さを計る(熱膨張)・など。

これらの条件を満足するばあいは.理想的測定の場合に限られます。ですから.「理想的測定」を行っていれば.正規文武になりますが.なんだか野問題がある場合には.せいきぷんぷ二なり増せなん。通じようは.測定値の分布を調べて.正規分布になったらば「測定に間違いはなかった」として処理します。正規分布以外の分布となった場合には.原因を突き止めることになります。多くの場合.測定方法の間違いとか.制御困難な特定の因子の影響によります。

>実験などの測定値が正規分布する
のではなく.実際には間違えた測定を行っているかもしれませんが.正規文武となったときに.正しい測定を行ったものとして処理する
のです。
    • good
    • 0
この回答へのお礼

実験の測定値について、ずばりの回答でありがたいです。
みなさまが言うように、偶然誤差や変数(?)のせいなのですね。
助かりました。ありがとうございました!

お礼日時:2004/02/02 06:48

うまい説明が浮かんでこないんですが・・・


こんなので「解りやすい説明」になってるでしょうか?


二項分布という言葉を聞いたことがありますか?

二項分布に従うものの例としては、例えば、
コインを何枚も同時に投げたときに、表裏それぞれ何枚ずつか、という数(確率)が二項分布に従います。

たしか、コインの数を無限まで増やした場合(極限)を考えると、正規分布になったと思います。

あとは、#1さんのおっしゃるとおり、コインの裏表をパチンコなどにイメージし直せばいいような気がします。

なんといいますか、
例えば、一定寸法のものを製造しようとすれば、製造工程などで、長いほうに外れようする力(?)と、短いほうに外れようとする力(?)のどちらかが、刻一刻何度も何度も働いて、それがパチンコのように人生の分かれ道を何度も何度も選んで進んでいるかのごとく・・・。
    • good
    • 0
この回答へのお礼

二分分布はわかります。
なるほど、無限まで増やすとなるのですね。
確か式にも無限が使われていましたね。
どうもありがとうございました!

お礼日時:2004/02/02 06:45

パチンコ台またはコリントゲームの台のようなものを想像してください。


一定の位置から一定の力で玉を打ち出したとしても,玉の到着位置は一定にならず,散らばります。
玉の打ち出し速度,玉の重さ,大きさ,釘への当たり方,跳ね返り方,など途中にあるいろいろな原因が積み重なって,玉の進路をばらつかせるからです。
それと同様に,細かい変動を起こす多数の原因によって測定の結果がばらつくことになります。
多数の細かい原因によって値が変動するモデルによる値のばらつきの結果が理論的に正規分布になるそうです。

(パチンコ台の釘による玉の到着位置のばらつきは本当は理論的には正規分布とは異なるものだそうですけれど,概念的理解のために持ち出しました)
    • good
    • 0
この回答へのお礼

具体的な例を使って下さったので、解りましたー。
誤差によって云々・・というのはなんとなくわかっていたのですが、やっとすっきりしました。
どうもありがとうございます!

お礼日時:2004/02/02 06:43

お探しのQ&Aが見つからない時は、教えて!gooで質問しましょう!

このQ&Aを見た人はこんなQ&Aも見ています

このQ&Aを見た人が検索しているワード

このQ&Aと関連する良く見られている質問

Q世の中全てが「正規分布」なのか?

世の中の多くの事象が正規分布に従う (→ 中心極限定理?)があります。 (多くの例外があるどころか、むしろ正規分布に従うものは少ないこともわかってきた・・・ などという意見もあるものの。)

・「じゃあ、サイコロはどうなんだ?」 

・「なぜ、サイコロやコインの話には、正規分布が当てはまらないんだ?」 

・・・という疑問に、答えを出すことができません。



たしかに、「なんとなく、そんなはずがないだろう」 という風には わかっているつもりなのですが、

「どういうものに、正規分布が当てはまる(と、統計学では仮定されることが多い?)のか」  ・・・ という風に あらためてきかれると、うまく説明ができずに もどかしい思いをしています。


「 どういう条件/事象について、 正規分布が当てはまるのか・・・?」

 という問いに、中高生にも理解ができるようなスッキリした 説明を、お願いします。  

Aベストアンサー

「 どういう条件/事象について、 正規分布が当てはまるのか・・・?」
中心極限定理そのままですが、その現象が、(互いに独立な)多数の要因(の足し合わせ)によって、起こっている場合です。

上で、「互いに独立な」にカッコをつけたのは、要因が非常に多数の場合には、この条件は不要になることが多いからです。また、「の足し合わせ」の条件も、要因が非常に多数の場合には、不要になることが多いです。
(ただし、これが成り立たない例外もいくつもありますが)

というわけで、通常は、注目している現象が、とにかく非常に多数の要因によって起こっている、と考えられる場合には正規分布になります。
サイコロであれば、サイコロを1個だけ投げるのであれば、正規分布ではありませんが、サイコロを1万個なげたときの出目の平均は、正規分布と考えてよいです。

Qデータが正規分布しているか判断するには???

初歩的なことですが。。急いでいます。
おわかりになる方 教えてください。
サンプリングしたデータが正規分布しているかどうかを確認するにはどうすればよろしいでしょうか。
素人でも分かるように説明したいのですが。。
定性的にはヒストグラムを作り視覚的に訴える方法があると思います。今回は定量的に判断する方法を知りたいです。宜しくお願いします。

Aベストアンサー

>機械的に処理してみるとできました。
>でも理屈を理解できていません。
 とりあえず、理屈は後で勉強するとして、有意水準5%で有意差あり(有意確率が0.05以下)であれば、正規分布ではないと結論づけてお終いでいいのではないですか。
>この検定をもっと初心者でもわかりやすく解説しているサイト等ご存じありませんか。
 私が知っている限りでは、紹介したURLのサイトが最も丁寧でわかりやすいサイトでした。
>データの区間を分けるときのルール等ありますでしょうか。
 ヒストグラムを作成する場合、区間距離、度数区分数は、正規的なグラフになるように試行錯誤で行うことが多い(区間距離や度数区分数を本来の分布に則するようにいろいろ当てはめて解釈する。データ個数の不足や、データの取り方、または見かけ上の分布によりデータのばらつきが正しく反映されて見えないことがあるため)のですが、度数区分数は、機械的に、
=ROUNDUP(1+LOG10(データ個数)/LOG10(2),0):エクセル計算式
で区分数を求める方法があります。
 また、区間距離は、=ROUND((データの最高値-最低値)/(度数区分数値-1),有効桁数)で求め、区分の左端は、
=ROUNDUP(データの最低値-区間距離/2,有効桁数)
右端は=ROUNDUP(データの最高値+区間距離/2,有効桁数)
とします。
 区間がと度数区分数が出たら、その範囲にあるデータ数を数えて、ヒストグラムができます。
 
>最小側、最大側は 最小値、最大値を含んだ値としなければならないのでしょうか。
 ヒストグラム作成の処理に関しては、上記を参考にしてください。
 その前に、データの最小値と最大値が、正しくとれたデータか検討するため、棄却検定で外れ値が存在するか否かを検定し、外れ値が存在しないと結論づけられたら、正規分布の検定を行ってみてください。もし外れ値が存在する可能性があれば、そもそも、そのデータの信頼性が失われます。サンプリング手法の再検討(データの取り方に偏りがなかったか、無作為に設定してデータを取っていたか等)をして、再度データを得る必要があります。また、そもそも検定する以前に、データ数が少ないと判断が付かなくなってしまいますので、データ数は十分揃える(少なくとも20~30個)必要もあります。

>機械的に処理してみるとできました。
>でも理屈を理解できていません。
 とりあえず、理屈は後で勉強するとして、有意水準5%で有意差あり(有意確率が0.05以下)であれば、正規分布ではないと結論づけてお終いでいいのではないですか。
>この検定をもっと初心者でもわかりやすく解説しているサイト等ご存じありませんか。
 私が知っている限りでは、紹介したURLのサイトが最も丁寧でわかりやすいサイトでした。
>データの区間を分けるときのルール等ありますでしょうか。
 ヒストグラムを作成する場合、区...続きを読む

Q正規分布に従わないと標準偏差の算出は向かないでしょうか?

正規分布に従うとは、平均値の分布が多いという意味でしょうか?

日々変わるデータの点数が凸のような分布でなく、平均値付近が少ない
凹のようなデータの集合だと、標準偏差を算出し正規分布を使い
30%以下の人や70%以上の人を毎日抽出するような用途には
向かないのでしょうか?

Aベストアンサー

まず、正規分布に従うとは、「分布が正規分布のグラフと同じ形をする事」をいいます。
そのため、平均辺りが多くても△のような分布グラフだったり、
左右が対象でないと、「正規分布に従う」とは言いません。

そのため、試験の成績などは、「正規分布に近い」だけであって、
「正規分布に従っている」のではありません。

つまり、「偏差値」を使うべきかどうかは、偏差値の「分かりやすさ」と、
その分布が正規分布に近いかどうかの判断になります。



例えば、凹のようなデータでも、両端がなだらかになっていれば、そこそこ偏差値も使えます。

逆に、両端が崖のようになっていると、偏差値を使うのは控えた方がいいでしょう。
(たとえば、30点や、80点の人は多いけど、29点以下や、81点以上がいないなど)

また、分布が左右対称でない場合も、使用をやめた方がいいでしょう。
平均値と、中央値(順位が真ん中の人の値)が離れると、偏差値の感覚的な値とは
ずれてきます。



いずれにしても、ある程度のデータがあるのであれば、そのデータで
やってみるのが一番です。

出るべき結果と大きなずれがなければ、分かりやすいので使ってしまっても
いいのではないでしょうか。

試験の結果なんかでも、山が二つあったり、左右に偏っている事なんて
よくあります。

それでも、偏差値が、それなりに機能していますから、まずはやってみるのが
いいのではないかと思います。

まず、正規分布に従うとは、「分布が正規分布のグラフと同じ形をする事」をいいます。
そのため、平均辺りが多くても△のような分布グラフだったり、
左右が対象でないと、「正規分布に従う」とは言いません。

そのため、試験の成績などは、「正規分布に近い」だけであって、
「正規分布に従っている」のではありません。

つまり、「偏差値」を使うべきかどうかは、偏差値の「分かりやすさ」と、
その分布が正規分布に近いかどうかの判断になります。



例えば、凹のようなデータでも、両端がなだら...続きを読む

Q統計学的に信頼できるサンプル数って?

統計の「と」の字も理解していない者ですが、
よく「統計学的に信頼できるサンプル数」っていいますよね。

あれって「この統計を調べたいときはこれぐらいのサンプル数があれば信頼できる」という決まりがあるものなのでしょうか?
また、その標本数はどのように算定され、どのような評価基準をもって客観的に信頼できると判断できるのでしょうか?
たとえば、99人の専門家が信頼できると言い、1人がまだこの数では信頼できないと言った場合は信頼できるサンプル数と言えるのでしょうか?

わかりやすく教えていただけると幸いです。

Aベストアンサー

> この統計を調べたいときはこれぐらいのサンプル数があれば信頼できる・・・
 調べたいどの集団でも、ある一定数以上なら信頼できるというような決まりはありません。
 何かサンプルを集め、それをなんかの傾向があるかどうかという仮説を検証するために統計学的検定を行って、仮設が否定されるかされないかを調べる中で、どの検定方法を使うかで、最低限必要なサンプル数というのはあります。また、集めたサンプルを何か基準とすべき別のサンプルと比べる検定して、基準のサンプルと統計上差を出すに必要なサンプル数は、比べる検定手法により計算できるものもあります。
 最低限必要なサンプル数ということでは、例えば、ある集団から、ある条件で抽出したサンプルと、条件付けをしないで抽出したサンプル(比べるための基準となるサンプル)を比較するときに、そのサンプルの分布が正規分布(正規分布解説:身長を5cmきざみでグループ分けし、低いグループから順に並べたときに、日本人男子の身長なら170cm前後のグループの人数が最も多く、それよりも高い人のグループと低い人のグループの人数は、170cmのグループから離れるほど人数が減ってくるような集団の分布様式)でない分布形態で、しかし分布の形は双方とも同じような場合「Wilcoxon符号順位検定」という検定手法で検定することができますが、この検定手法は、サンプルデータに同じ値を含まずに最低6つのサンプル数が必要になります。それ以下では、いくらデータに差があるように見えても検定で差を検出できません。
 また、統計上差を出すのに必要なサンプル数の例では、A国とB国のそれぞれの成人男子の身長サンプルがともに正規分布、または正規分布と仮定した場合に「t検定」という検定手法で検定することができますが、このときにはその分布を差がないのにあると間違える確率と、差があるのにないと間違える確率の許容値を自分で決めた上で、そのサンプルの分布の値のばらつき具合から、計算して求めることができます。ただし、その計算は、現実に集めたそれぞれのサンプル間で生じた平均値の差や分布のばらつき具合(分散値)、どのくらいの程度で判定を間違える可能性がどこまで許されるかなどの条件から、サンプル間で差があると認められるために必要なサンプル数ですから、まったく同じデータを集めた場合でない限り、計算上算出された(差を出すために)必要なサンプル数だけサンプルデータを集めれば、差があると判定されます(すなわち、サンプルを無制限に集めることができれば、だいたい差が出るという判定となる)。よって、集めるサンプルの種類により、計算上出された(差を出すために)必要なサンプル数が現実的に妥当なものか、そうでないのかを、最終的には人間が判断することになります。

 具体的に例示してみましょう。
 ある集団からランダムに集めたデータが15,12,18,12,22,13,21,12,17,15,19、もう一方のデータが22,21,25,24,24,18,18,26,21,27,25としましょう。一見すると後者のほうが値が大きく、前者と差があるように見えます。そこで、差を検定するために、t検定を行います。結果として計算上差があり、前者と後者は計算上差がないのにあると間違えて判断する可能性の許容値(有意確率)何%の確率で差があるといえます。常識的に考えても、これだけのサンプル数で差があると計算されたのだから、差があると判断しても差し支えないだろうと判断できます。
 ちなみにこの場合の差が出るための必要サンプル数は、有意確率5%、検出力0.8とした場合に5.7299、つまりそれぞれの集団で6つ以上サンプルを集めれば、差を出せるのです。一方、サンプルが、15,12,18,12,21,20,21,25,24,19の集団と、22,21125,24,24,15,12,18,12,22の集団ではどうでしょう。有意確率5%で差があるとはいえない結果になります。この場合に、このサンプルの分布様式で拾い出して差を出すために必要なサンプル数は551.33となり、552個もサンプルを抽出しないと差が出ないことになります。この計算上の必要サンプル数がこのくらい調査しないといけないものならば、必要サンプル数以上のサンプルを集めて調べなければなりませんし、これだけの数を集める必要がない、もしくは集めることが困難な場合は差があるとはいえないという判断をすることになるかと思います。

 一方、支持率調査や視聴率調査などの場合、比べるべき基準の対象がありません。その場合は、サンプル数が少ないレベルで予備調査を行い、さらにもう少しサンプル数を増やして予備調査を行いを何回か繰り返し、それぞれの調査でサンプルの分布形やその他検討するべき指数を計算し、これ以上集計をとってもデータのばらつきや変化が許容範囲(小数点何桁レベルの誤差)に納まるようなサンプル数を算出していると考えます。テレビ視聴率調査は関東では300件のサンプル数程度と聞いていますが、調査会社ではサンプルのとり方がなるべく関東在住の家庭構成と年齢層、性別などの割合が同じになるように、また、サンプルをとる地域の人口分布が同じ割合になるようにサンプル抽出条件を整えた上で、ランダムに抽出しているため、数千万人いる関東の本当の視聴率を割合反映して出しているそうです。これはすでに必要サンプル数の割り出し方がノウハウとして知られていますが、未知の調査項目では必要サンプル数を導き出すためには試行錯誤で適切と判断できる数をひたすら調査するしかないかと思います。

> どのような評価基準をもって客観的に信頼できると判断・・・
 例えば、工場で作られるネジの直径などは、まったくばらつきなくぴったり想定した直径のネジを作ることはきわめて困難です。多少の大きさのばらつきが生じてしまいます。1mm違っても規格外品となります。工場では企画外品をなるべく出さないように、統計を取って、ネジの直径のばらつき具合を調べ、製造工程をチェックして、不良品の出る確率を下げようとします。しかし、製品をすべて調べるわけにはいきません。そこで、調べるのに最低限必要なサンプル数を調査と計算を重ねてチェックしていきます。
 一方、農場で生産されたネギの直径は、1mmくらいの差ならほぼ同じロットとして扱われます。また、農産物は年や品種の違いにより生育に差が出やすく、そもそも規格はネジに比べて相当ばらつき具合の許容範囲が広くなっています。ネジに対してネギのような検査を行っていたのでは信頼性が損なわれます。
 そもそも、統計学的検定は客観的判断基準の一指針ではあっても絶対的な評価になりません。あくまでも最終的に判断するのは人間であって、それも、サンプルの質や検証する精度によって、必要サンプルは変わるのです。

 あと、お礼の欄にあった専門家:統計学者とありましたが、統計学者が指摘できるのはあくまでもそのサンプルに対して適切な検定を使って正しい計算を行ったかだけで、たとえ適切な検定手法で導き出された結果であっても、それが妥当か否か判断することは難しいと思います。そのサンプルが、何を示し、何を解き明かし、何に利用されるかで信頼度は変化するからです。
 ただ、経験則上指標的なものはあります。正規分布を示すサンプルなら、20~30のサンプル数があれば検定上差し支えない(それ以下でも問題ない場合もある)とか、正規分布でないサンプルは最低6~8のサンプル数が必要とか、厳密さを要求される調査であれば50くらいのサンプル数が必要であろうとかです。でも、あくまでも指標です。

> この統計を調べたいときはこれぐらいのサンプル数があれば信頼できる・・・
 調べたいどの集団でも、ある一定数以上なら信頼できるというような決まりはありません。
 何かサンプルを集め、それをなんかの傾向があるかどうかという仮説を検証するために統計学的検定を行って、仮設が否定されるかされないかを調べる中で、どの検定方法を使うかで、最低限必要なサンプル数というのはあります。また、集めたサンプルを何か基準とすべき別のサンプルと比べる検定して、基準のサンプルと統計上差を出すに必要な...続きを読む

Qエクセル STDEVとSTDEVPの違い

エクセルの統計関数で標準偏差を求める時、STDEVとSTDEVPがあります。両者の違いが良くわかりません。
宜しかったら、恐縮ですが、以下の具体例で、『噛み砕いて』教えて下さい。
(例)
セルA1~A13に1~13の数字を入力、平均値=7、STDEVでは3.89444、STDEVPでは3.741657となります。
また、平均値7と各数字の差を取り、それを2乗し、総和を取る(182)、これをデータの個数13で割る(14)、この平方根を取ると3.741657となります。
では、STDEVとSTDEVPの違いは何なのでしょうか?統計のことは疎く、お手数ですが、サルにもわかるようご教授頂きたく、お願い致します。

Aベストアンサー

データが母集団そのものからとったか、標本データかで違います。また母集団そのものだったとしても(例えばクラス全員というような)、その背景にさらならる母集団(例えば学年全体)を想定して比較するような時もありますので、その場合は標本となります。
で標本データの時はSTDEVを使って、母集団の時はSTDEVPをつかうことになります。
公式の違いは分母がn-1(STDEV)かn(STDEVP)かの違いしかありません。まぁ感覚的に理解するなら、分母がn-1になるということはそれだけ結果が大きくなるわけで、つまりそれだけのりしろを多くもって推測に当たるというようなことになります。
AとBの違いがあるかないかという推測をする時、通常は標本同士の検証になるわけですので、偏差を余裕をもってわざとちょっと大きめに見るということで、それだけ確証の度合いを上げるというわけです。

Qカイ2乗検定って何??;;

タイトルのとおりですが…大学で統計の基礎な授業を一般教養で受けています。だけど知らない&説明のない言葉がいっぱぃで、全くついていけません(>_<))
「人が一番選ばなさそうな数字」を何度か投票した結果があって、その数字は無作為に選ばれてるかどうか、有意水準1%としてカイ2乗検定をして判断する、という問題があるのですが、カイ2乗検定自体、授業でちらっと言葉は使ったものの、計算の仕方、使い方の説明等はなく、まったく手がつかずにいます;;ネットでも調べてみましたが、どう使っていいのかまでは分かりませんでした。
知識の無い私でもわかるようなものがあれば教えて下さいっっ!お願いします。

Aベストアンサー

こんにちは.χ2(カイ二乗)検定を厳密に理解するには,数学的素養を持っている状態できっちりと統計学を学習する必要があるのですが,統計データを解析するための手段として統計学を「使う」のであれば,多少の原理を知っておけばよいでしょう.
以下初学者向けにかなり乱暴な説明をしています.正確な理解をしたければ,後で統計学の教科書などで独学して下さい.

χ2検定とは,χ2分布という確率分布を使ったデータ解析法と考えてもらう……のが一番なのですが,多分χ2分布って何? と思われるでしょう.χ2分布とは,二乗値に関する確率分布と考えることができるのですが,この辺もさらりと流して下さい.

例を使って説明します.今,道行く人にA,B,C,Dの四枚のカードの中から好きなもの一枚を選んでもらうとしましょう(ただし,選んでもらうだけで,あげるわけではありません.単にどのカードを選択仕方の情報を得るだけです).一人一枚だけの条件で,160人にカードを選んでもらいました.
さて,ここで考えてみて下さい.4枚のカードには大きな違いはなく,どれを選んでもかまわない.でたらめに選ぶとなれば,どのカードも1/4で,同じ確率で,選ばれるはずですよね? ならば,160人データならば,Aは何枚ほど選ばれる「はず」でしょうか? 同様に,B,C,Dは何枚選ばれる「はず」でしょうか?
……当然,A=B=C=D=40枚の「はず」ですよね? この40枚という数値はでたらめに(無作為に)選ばれたとしたらどんな数値になるかの【理論値】を意味します.

さて,上記はあくまでも理論値であり,実際のデータは異なる可能性があります.というよりはむしろ違っているのがふつうでしょう.そのような実際に観測された数値を【観測値】と呼びます.
仮に理論値と観測値が以下のようになったとします.

        A    B    C    D
(1)観測値   72   23   16   49
(2)理論値   40   40   40   40

当然のように観測値と理論値にズレが生じています.しかし現実と理論が異なるのはある意味当然なのですからぴったり一致することなどありえません.そこで,「ある程度一致しているか(ズレは許容範囲か)」を問題にすることになります.しかし,「ある程度」といわれても一体どのぐらいであれば「ある程度」と言えるのでしょうか? なかなか判断が難しいではないですか?
確かに判断が難しいです.そこで,この判断のために統計学の力を借りて判断するわけで,更に言えばこのような目的(理論値と観測値のズレが許容範囲かどうか)を検討するときに使われるデータ解析法がχ2検定なのです.

        A    B    C    D
(1)観測値   72   23   16   49
(2)理論値   40   40   40   40
(3)ズレ    +32   -17   -14   + 9
(4)ズレ二乗 1024   289   196   81
(5)(4)÷(2) 25.6  7.225  4.9  2.025

 χ2=25.6+7.225+4.9+2.025=49.25

計算過程をさらりと書いていますが,早い話が観測値と理論値のズレの大きさはいくらになるのか,を求めることになります.最終的には「49.25」というズレ値が算出されました.

さて,この「49.25」というズレ値が許容範囲かどうかの判定をするのですが,ここで,χ2分布という確率分布を使うことになります.詳細は統計学教科書を参考してもらうとして,χ2分布を使うと,○○というズレ値が(ある条件では)どのぐらい珍しいことなのか,という「珍しさの確率」を教えてくれます.
かりに「有意水準1%=1%よりも小さい確率で発生することはすごく珍しいと考える(許容範囲と考えられない)」とすれば,「珍しさ確率」が1%以内であれば「許容範囲ではない」と判断します.

以上,長々と書きました.今までの説明を読めばわかるように,χ2検定とはある理論値を想定した時,実際の観測値がその理論値とほぼ一致しているかどうかを調べるための統計解析法のことです.

χ2検定では,理論値をどのように設定するかは分析者の自由です.その設定の仕方で,χ2検定は「適合度の検定」や「独立性の検定」など異なる名称が付与されますが,本質は同じなのです.

質問者さんの場合は

> 「人が一番選ばなさそうな数字」を何度か投票した結果があって、その数字は無作為に選ばれてるかどうか、

これを理論値としてうまく設定することが鍵となるでしょう.

こんにちは.χ2(カイ二乗)検定を厳密に理解するには,数学的素養を持っている状態できっちりと統計学を学習する必要があるのですが,統計データを解析するための手段として統計学を「使う」のであれば,多少の原理を知っておけばよいでしょう.
以下初学者向けにかなり乱暴な説明をしています.正確な理解をしたければ,後で統計学の教科書などで独学して下さい.

χ2検定とは,χ2分布という確率分布を使ったデータ解析法と考えてもらう……のが一番なのですが,多分χ2分布って何? と思われるでしょう.χ2分布...続きを読む

Q相関係数についてくるP値とは何ですか?

相関係数についてくるP値の意味がわかりません。

r=0.90 (P<0.001)

P=0.05で相関がない

という表現は何を意味しているのでしょうか?
またMS Excelを使ってのP値の計算方法を教えてください。

よろしくお願い致します。

Aベストアンサー

pは確率(probability)のpです。全く相関のない数字を組み合わせたときにそのr値が出る確率をあらわしています。

統計・確率には100%言い切れることはまずありません。というか100%言い切れるのなら統計・確率を使う必要は有りません。
例えばサイコロを5回振って全て同じ目が出る確率は0.08%です。そんな時、そのサイコロを不良品(イカサマ?)と結論つけるとわずかに間違っている可能性が残っています。ただ、それが5%以下ならp=0.05でそのサイコロは正常ではないと結論付けます。
それが危険率です。(この場合はp=0.1%でもいいと思いますが)
相関係数においても相関の有無を結論つけるにはそのrが偶然出る確率を出すか、5%の確率ならrがどれぐらいの値が出るかを知っておく必要が有ります。

>r=0.90 (P<0.001)

相関係数は0.90と計算された。相関がないのに偶然r=0.90 となる確率は0.001以下だと言ってます。

>P=0.05で相関がない

相関がないと結論。(間違っている確率は5%以下)だと言ってます。

エクセルでの計算ですが、まず関数CORRELを使ってr値を出します。xデータがA1からA10に、yデータがB1からB10に入っているとして

r=CORREL(A1:A10,B1:B10)

次にそのr値をt値に変換します。

t=r*(n-2)^0.5/(1-r^2)^0.5

ここでnは組みデータの数です。((x1,y1),(x2,y2),・・・(xn,yn))
最後に関数TDISTで確率に変換します。両側です。

p=TDIST(t値,n-2,2)

もっと簡単な方法があるかも知れませんが、私ならこう計算します。(アドインの分析ツールを使う以外は)

pは確率(probability)のpです。全く相関のない数字を組み合わせたときにそのr値が出る確率をあらわしています。

統計・確率には100%言い切れることはまずありません。というか100%言い切れるのなら統計・確率を使う必要は有りません。
例えばサイコロを5回振って全て同じ目が出る確率は0.08%です。そんな時、そのサイコロを不良品(イカサマ?)と結論つけるとわずかに間違っている可能性が残っています。ただ、それが5%以下ならp=0.05でそのサイコロは正常ではないと結論付けます。
それが危険率です。(この場...続きを読む

Q対数変換する意味?

私は数学が苦手な文系大学生です。最近「地域分析」という本を読んでいるのですが、たびたび数式を「対数変換すると・・・」と言う風に話が進みます。対数変換をすることの意味がわからないので内容が理解できません。

まず、対数変換とは何なのか?対数変換を行なうと何がどのように変わるのでしょうか?
また、一般的に対数変換とはどのような目的で行なわれるのでしょうか?

ということを文系の学生にわかりやすく教えていただけないでしょうか。
対数変換の内容を理解していないため、質問が的を得ていないかもしれませんが、よろしくお願いします。(また、ここで説明できるような内容でなければ、その旨をお伝えください。)

Aベストアンサー

まず、ここで論じられている「対数」が「常用対数」を意味する
ことを前提として話を進めましょう。

対数に変換するということは、ある数値を
任意の底の値の指数値で表すことを意味します。
具体的に言うと(ここでは常用対数に限定することにしたので)、
ある数値が10(これが常用対数の底の値)の何乗であるのか
ということです。

たとえば、100という数値の常用対数を取ると、
100は10の2乗ですから、「2」となります。
同様に1000は「3」、10000は「4」です。

このように表現すると、正の数値で1以下の小数から
万や億などの非常に大きい値に散らばる数値サンプルを
整理したり表現するのに非常に便利です。

また、対数にしてグラフを作ると、上記のように非常に
大きな数(または0.00000・・・・のように非常に小さい数)
を限られた紙面上でプロットする事ができます。
もしそのプロットした結果が直線になった場合、
その直線の傾きでサンプルの近似式を導き出すこともできます。

具体的例を挙げると、身近なものではpH値。
これはある液体の単位量あたりどのくらい水素イオンが
含まれるかを対数表現したものです。
(厳密には、モル濃度で表した水素イオン濃度の逆数の常用対数)

まとめると、対数は小数から数万・億などの広範囲に散らばる
数値を整理するために使われる道具とお考えになられたら
良いと思います。

まず、ここで論じられている「対数」が「常用対数」を意味する
ことを前提として話を進めましょう。

対数に変換するということは、ある数値を
任意の底の値の指数値で表すことを意味します。
具体的に言うと(ここでは常用対数に限定することにしたので)、
ある数値が10(これが常用対数の底の値)の何乗であるのか
ということです。

たとえば、100という数値の常用対数を取ると、
100は10の2乗ですから、「2」となります。
同様に1000は「3」、10000は「4」です。

この...続きを読む

Q「ご連絡いたします」は敬語として正しい?

連絡するのは、自分なのだから、「ご」を付けるのは
おかしいのではないか、と思うのですが。
「ご連絡いたします。」「ご報告します。」
ていうのは正しい敬語なのでしょうか?

Aベストアンサー

「お(ご)~する(いたす)」は、自分側の動作をへりくだる謙譲語です。
「ご連絡致します」も「ご報告致します」も、正しいです。

文法上は参考URLをご覧ください。

参考URL:http://www.nihongokyoshi.co.jp/manbou_data/a5524170.html

Q「ノルム、絶対値、長さ」の違いについて

あじぽんと申します。よろしくお願いします。

ベクトルや複素数などに出てくる「ノルムと絶対値と長さ」というのは同じことを違う言葉で表現しているのでしょうか?
手元にある書籍などには全てが同じ式で求められています。
同じ式で表現されていても意味は少しづつ違っていたりするのでしょうか?

よろしくお願いします。

Aベストアンサー

どれも同じような性質を持ちますが、違いの1つとして定義される空間が違います。

「絶対値」は、実数や複素数といった「数」に対して定義されます。
定義は、一通りしかありません。
ベクトルに対して、絶対値を求めるという言い方をする場合もあるかもしれませんが、それはベクトルの長さを表す記号に絶対値の記号を利用する場合があるからであり、参考書にも文章として「ベクトルの絶対値」という言い方はあまりされていないのではないでしょうか?



「長さ」というのは、空間にある「線」に対して定義できます。
数に対しては「長さ」という言い方はあまり聞かないと思います。
例えば、「3」の長さというような言い方は耳になじまないと思います。
一方、ベクトルの場合は、「矢印」という「線」になりますので「長さ」が定義できます。



最後の「ノルム」は、線形空間に対して定義できます。(もちろん実数、複素数やベクトルも線形空間です)
ノルムの条件を満たせばノルムになるため、複数のノルムが考えられます。
そのため、「(1,1)というベクトルに対するノルムは?」
という質問に対しては、「どのノルムを使うか?」という条件が欠けているため厳密に言うと「解答はできません」。
例としてよく扱われるノルムは「ユークリッドノルム」と言われ、通常のベクトルの長さと等しくなります。

ベクトルに対するノルムでは、「最大値ノルム」というのが他の例としてよく使われます。
これは、ベクトルの各要素の最大値で定義されます。
(例:(3,1,5)というベクトルの最大値ノルムは、3つの数字の最大値である5になります)

ノルムというと、線形空間であれば定義できるため、
f(x) = 3x^2+5x
という数式に対するノルムというのも考えられます。
(数式は、定数倍したり、足し算したりできますよね)
数式に対して「絶対値」とか「長さ」と言ってもピンと来ないですよね。

しかし、まだやられていないかもしれませんが、数式に対するノルムというのは存在します。


そうすると、なんでこんなんがあるねん。って話になると思います。

ここで、ベクトルに対してある定理があったとします。

それがさっきのような数式など他の線形空間でも成り立つんだろうか?
というのを考えるときに「ノルム」の登場です。

その定理の証明で、「ベクトル」として性質を使わずに「ノルム」の性質だけを使って証明ができれば、
それは「ベクトル」に対する証明でなくて「ノルムを持つもの」に対する証明になります。
(ちょっと難しいかな?)


このようにして、定理の応用範囲を広げるために「長さ」や「絶対値」の考え方をベクトルだけでなく「線形空間」という広い考え方に適用できるようにしたのが「ノルム」になります。

どれも同じような性質を持ちますが、違いの1つとして定義される空間が違います。

「絶対値」は、実数や複素数といった「数」に対して定義されます。
定義は、一通りしかありません。
ベクトルに対して、絶対値を求めるという言い方をする場合もあるかもしれませんが、それはベクトルの長さを表す記号に絶対値の記号を利用する場合があるからであり、参考書にも文章として「ベクトルの絶対値」という言い方はあまりされていないのではないでしょうか?



「長さ」というのは、空間にある「線」に対して...続きを読む


このQ&Aを見た人がよく見るQ&A

人気Q&Aランキング