2008年2月19日 星期二

Google---資源描述架構(RDF) 在都柏林核心集的應用介紹

一、前言

資源描述結構(Resource Description Framework,簡稱 RDF)是一個用來攜帶多種不同的元資料來往於網路上的工具。[註 1] 元資料(Metadata)最常見的英文定義是 "data about data",可直譯為描述資料的資料,主要是描述資料屬性的資訊,用來支持如指示儲存位置、資源尋找、文件紀錄、評價、過濾等的功能。以圖書館的角度來看,就其本義和功能而言,元資料可說是電子式目錄,因為編製目錄的目的,即在描述收藏資料的內容或特色,進而達成協助資料檢索的目的。[註 2] 因此元資料是用來揭示各類型電子文件或檔案的內容和其他特性,其典型的作業環境是電腦網路作業環境。換言之,元資料是因應現代資料處理上的二大挑戰而興起的:一是電子檔案成為資料的主流,另外一個是網路上大量文件的管理和檢索需求。

至於元資料的種類,下面是一些常見的清單。首先,國際圖書館協會聯盟(International Federation of Library Association and Institutions,簡稱 IFLA)在描述元資料資源的首頁中 [註 3],列舉了以下的元資料種類: Dublin Core、EAD(Encoded Archival Description)、FGDC's Content Standard for Digital Geospatial Metadata、DIF (Directory Interchange Format)、GILS (Government Information Locator Service)、IAFA/whois++ templates、MARC、PICS (Platform for Internet Content Selection)、RDM(Resource Description Messages)、SOIF(Summary Object Interchange Format)、SHOE(Simple HTML Ontology Extensions)、TEI、URC(Uniform Resource Characteristics)、X3L8 Proposed ANSI standard for data representation。

其次是在『Judy And Magda's List of Metadata Initiatives』的網頁中,按類別提出一些經常被廣泛使用或具有潛力的元資料如下︰ [註 4]

(一) 通用描述型 -- MARC、Dublin Core、Edinburgh Engineering Virtual Library (EEVL)、Semantic Header for Internet Documents、GILS、URC、X3L8 Proposed ANSI standard for data representation、IAFA Templates、NetFirst、Header for HTML documents、SOIF、MCF(Meta content Format)、PICS。

(二) 文字檔描述型 -- TEI、BibTex、Gruber Ontology for Bibliographic Data、RFC 1807。

(三) 數據資料類-- ICPSR Data Documentation Initiative、SDSM(Standard for Survey Design and Statistical Methodology Metadata)。

(四) 音樂類 -- SMDL(Standard Music Description Language)、

(五) 圖像與物件類 -- CDWA(Categories for the Description of Works of Art)、CIMI(Consortium for the Computer Interchange of Museum Information)、VRA Core Categories、MESL Data Dictionary。

(六) 地理資料類 -- FGDC's Content Standards for Digital Geospatial Metadata。

(七) 檔案保存類 -- EAD、Z39.50 Profile for Access to Digital Collections、Fattahi Prototype Catalogue of Super Records。

由以上的列表和清單可知,因為網路資源的種類複雜,用途殊異,因此多種元資料共存共榮實為不可避免的趨勢,因此需要有一種適當的工具,來同時攜帶多種元資料來往於網路上,而「資源描述架構」即為此種工具之一。

資源描述結構(Resource Description Framework,簡稱 RDF)是由全球資訊網協會(W3C)主導和結合多個元資料團體(如都柏林核心集等)所發展而成的一個架構,可用來攜帶多種不同的元資料來往於網際網路和WWW上。因為W3C先前曾致力發展一個元資料─PICS(Platform for Internet Content Selection) [註 5],因此RDF受到PICS很深的影響,在語法上則是遵循另一個W3C致力推廣的架構 -- XML(Extensible Markup Language)[註 6],由於目前XML已受到業界廣泛的支持,如瀏覽器的兩大霸主Netscape [註 7] 和 Internet Explorer [註 8] 都已經各自製作使用XML格式的元資料規格,並且也已呈送W3C審核,因此XML與RDF的發展可說是備受矚目。

二、RDF的核心資料模式與聲明的機制

以下根據W3C 的RDF工作小組的草案 [註 9],來對 RDF模型做更進一步的介紹,基本上RDF是一個與任何特定(電腦)語法無關的抽象的資料(表達)模式,用來呈現一個特性與其值。而所謂的「特性」(Property),可能是

資源的屬性:如題名、著者等,都柏林核心集的題名(Title)欄位即可歸屬於這類。

資源間的關係:如都柏林核心集的關連(Relation)和來源(Source)兩欄位即屬於這類範疇。

RDF的另外一個特點是語法獨立性,因此兩段看起來差異很大的RDF陳述,事實上可能是描述相同的一件事,這是因為RDF是一個抽象的資料模式。由於這個抽象的特點,各種不同的元資料(如都柏林核心集)均可利用此種抽象的資料模式,來表達它們的內容。

RDF的核心資料模式(RDF Core)定義如下:

(一) N:一個點(Node)的集合(Set),此處的「集合」是一個數學的名詞和概念,在此的意義和用法正如在數學中一般。而「點」可以是一個資源(如網頁)或是物件(Object),甚至可以是一個「特性」(Property)。[作者註:「特性」的意義請參見前面的描述。]

(二) P(特性型態):是一個 N 的子集合(Subset)。

(三) T:一個含有三個元素的「有序對」(Tuple),其形式為(P, N, V),即有序對中的第一個元素來自前面的集合 P,第二個元素來自前面的集合 N,第三個元素V可以是來自集合 N,或者是一個單純的值(如字串 ”吳政叡”)。

例子:吳政叡是網頁 http://mes.lins.fju.edu.tw 的著者,可用RDF的有序對表示如下:

{著者,[http://mes.lins.fju.edu.tw],[吳政叡]}

上述的有序對中,著者是一個「特性」,[吳政叡]是此特性的值,網頁 http://mes.lins.fju.edu.tw 是一個點(Node)。

從另外一個角度,可把RDF核心資料模式的三個元素有序對(P, N, V),以數學中的圖學表示如下:

N -- P -- > V

即將 N 和V視為點,P是從N 到V弧線的標示,因此上述的例子又可表示為

[http://mes.lins.fju.edu.tw] -- 著者 -- > [吳政叡]

此外又可透過所謂的「具體化」(Reification)將「特性」(Property)變成一個新的點(假設為 X),從而產生三個新的有序對如下:

(一) {PropName, X, P}。

(二) {PropObj, X, N}。

(三) {PropValue, X, V}。

以上面的例子來說,若將「特性」著者具體化為新的點X後,將產生如下的三個新有序對

(一) {PropName, X, 著者}。

(二) { PropObj, X, [http://mes.lins.fju.edu.tw]}。

(三) { PropValue, X, [吳政叡]}。

若將描述同一個資源的眾多特性的有序對集結起來,即成為RDF的「聲明」(Assertion),例如描述網頁 http://mes.lins.fju.edu.tw 的兩個有序對

(一) {著者,[http://mes.lins.fju.edu.tw],[吳政叡]}

(二) {題名,[http://mes.lins.fju.edu.tw],[吳政叡的首頁]}

組合起來即構成RDF的「聲明」。

三、一個都柏林核心集記錄的RDF實例

都柏林核心集(Dublin Core)為備受矚目的元資料之一,是 1995 年 3 月由國際圖書館電腦中心(Online Computer Library Center,簡稱OCLC)和 National Center for Supercomputing Applications(NCSA)所聯合贊助的研討會,經過五十二位來自圖書館、電腦和網路方面的學者和專家,共同研討下的產物。目的是希望建立一套描述網路上電子文件特色的方法,來協助資訊檢索。研討會的中心問題是--如何用一個簡單的元資料記錄來描述種類繁多的電子物件?[註 10] 主要的目標是發展一個簡單有彈性,且非圖書館專業人員也可輕易了解和使用的資料描述格式,來描述網路上的電子文件。

都柏林核心集最近一次的研討會為第五次研討會,於1997年10月6-8日在芬蘭的赫爾辛基舉行,由於在寫作本書時,第五次研討會的正式報告尚未出版,祇好先根據澳洲國家圖書館的一位與會者--Bemal Rajapatirana的報告先行介紹第五次研討會的情況與成果 [註11],待第五次研討會的正式報告出爐後,作者會另撰專文來加以介紹。

根據Bemal Rajapatirana的報告,與會者達成了如下的幾項共識:

(一) 加快標準化的腳步—由於都柏林核心集的15個基本項目架構,自第四次研討會以來已普遍獲得認同,同時都柏林核心集也得到世界各國很多研究者的肯定,並且嘗試建造系統,此時若無一定的標準來遵循,將使系統的建造者無所適從和系統的更改頻繁。因此基於都柏林核心集已趨成熟的共識,決定推派代表撰寫RFC的草案,呈交給 IETF進行標準化的過程。

(二) 區分簡單和複雜兩種都柏林核心集格式—簡言之,所謂簡單(simple)和複雜(complex)格式的區分,一般而言主要是以有無使用任何修飾詞作為標準來劃分的。由於都柏林核心集的15個基本項目已有共識,因此簡單都柏林核心集的標準化過程將會較早開始。

(三) 語法上採用HTML和RDF格式為主—HTML的格式目前是使用4.0版本,寫法請參見作者的另一篇文章 [註 12]。

(四) 成立工作小組—針對一些尚未有定論的議題,組成工作小組進行研討,主要有

(1) 內容或格式尚未有定論的基本項目,如Date、Relation、Rights Management等項目。

(2) 修飾詞。

(3) 特殊性議題,如都柏林核心集和Z39.50間的互換。

(五) 次項目(或類別修飾詞)的制定原則

(1) 與基本項目一致,都是可省略的選擇項。

(2) 次項目須能進一步協助詮釋項目的內容。

(3) 祇展開一層,免得結構過於複雜。

(4) 數目盡可能精簡,有可能需要類別修飾詞的基本項目,將限於Title、Creator、Contributor、Publisher、Date、Relation、Coverage等。

1997年10月公布的資料著錄項目列表如下:[註13]

(一) 主題和關鍵詞(Subject):作品所屬的學術領域,控制語彙用 scheme 註明出處如 LCSH,亦可包含分類號如杜威十進分類號(Dewey Decimal Number)。

例子:Subject = 都柏林核心集。

(二) 題名(Title):作品名稱。

例子:Title = 都柏林核心集與元資料實驗系統。

(三) 著者(Creator):作品的創作者或組織。

例子:Creator = 吳政叡。

(四) 簡述(Description):文件的摘要或影像資源的內容敘述。

(五) 出版者(Publisher):負責發行作品的組織。

(六) 其他參與者(Contributors):除了著者外,對作品創作有貢獻的其他相關人士或組織。

〔註: 如書中插圖的製作者。〕

(七) 出版日期(Date):作品公開發表的日期,建議使用如下格式– YYYY-MM-DD和參考下列網址:http://www.w3.org/TR/NOTE-datetime。在此網頁中共規範有六種格式,都是根據國際標準日期暨時間格式 – ISO(國際標準組織)8601制定而成,是ISO 8601的子集合(subset),現在列舉和解說如下以供參考:[註 14]

例子:1997-09-07(西元1997年9月7日)。

(八) 資源類型(Type):作品的類型或所屬的抽象範疇,例如網頁、小說、詩、技術報告、字典等,建議參考下列網址:http://sunsite.berkeley.edu/Metadata/types.html。

例子:Type = Text.Dictionary。

例子:Type = 文字.技術報告。

(九) 資料格式(Format):告知檢索者在使用此作品時,所須的電腦軟體和硬體設備,例如 text/html(MIME格式)、ASCII、Postscript(一種印表機通用格式)、可執行程式、JPEG(一種通用圖像格式)。亦可擴展至非電子文件,例如book(書本)、叢書、期刊。

例子:Format = text/html。

(十) 資源識別代號(Identifier):字串或號碼可用來唯一標示此作品,例如URN、URL、ISSN、ISBN等。

(十一) 關連(Relation):與其他作品(不同內容範疇)的關連,或所屬的系列和檔案庫。

例子:Relation = http://mes.lins.fju.edu.tw/。

(十二) 來源(Source):作品從何處衍生而來(同內容範疇),例如莎士比亞的某個電子書出自那個紙本。

(十三) 語言(Language):作品所使用的語言,建議遵循 RFC 1766 的規定,請參考下列網址:http://ds.internic.net/rfc/rfc1766.txt,RFC 1766 是使用 ISO 639的二個字母的語言代碼。[註 15]

例子:Language = en。[註16]

(十四) 涵蓋時空(Coverage):作品所涵蓋的時期和地理區域。

(十五) 版權規範(Rights):作品版權聲明和使用規範。

以下是使用 XML語法和 RDF核心資料模式來攜帶一個都柏林核心集記錄的實例:



< xml::namespace href="http://www.w3.org/schemas/rdf-schema" as="RDF">





吳政叡

元資料實驗系統

都柏林核心集

元資料

有鑒於元資料對資料著錄和檢索的重要性,作者建立了一個相關的實驗系統—元資料實驗系統 (Metadata Experimental System,簡稱MES,網址: http://140.136.85.194/mes 或 http://mes.lins.fju.edu.tw/mes),作者建立MES目的,除了是讓讀者透過這個系統,對元資料及其未來的可能運作方式,有更具體的認知外;也希望利用此一實驗系統,來測試和驗證元資料的功能和效用,例如都柏林核心集這種簡易的資料描述格式,是否如制定者們所預期的,足以滿足大部分網路文件著錄和檢索的需求。MES是一開放性的實驗系統,歡迎任何人上站著錄自己的網頁或文件,以供他人查詢和檢索。





1997-009



homepage

text/html

http://140.136.85.194/mes

所有版權屬於吳政叡





下面的RDF文法是摘錄自W3C 的RDF工作小組 1997年10月2日公開的草案 [註 17],此文法是以電腦界通用的BNF(Backus-Naur Form)[註 18] 形式呈現,同時由於工作小組的草案是會隨時增修的,請自行連上W3C 的網站(http://www.w3.org/Metadata/RDF/Group/WD-rdf-syntax)查看最新的發展。

(一) RDF ::= ' ' node* ' '

(二) node ::= resource | assertions | aggregate

(三) resource ::= '' property* ''

(四) assertions ::= '' property* ''

(五) aggregate ::= sequence | bag | alternatives

(六) sequence ::= '' aggnode* ''

(七) bag ::= '' aggnode* ''

(八) alternatives ::= '' aggnode* ''

(九) aggnode ::= node | ''

(十) idRefAttr ::= hrefAttr | idAttr

(十一) hrefAttr ::= 'href="' resourceURI '"'

(十二) idAttr ::= 'id="' IDsymbol '"'

(十三) resourceURI ::= (see RFC1738)

(十四) IDsymbol ::= (any legal XML name symbol)

(十五) property ::= '<' propName idAttr? '>' propValue '' | '<' propName idRefAttr '/>'

(十六) propName ::= name | namePrefix ':' name

(十七) propValue ::= node | string

(十八) name ::= (any legal XML name symbol)

(十九) namePrefix ::= (any legal XML namespace prefix)

(二十) string ::= (any XML text)

四、結語

元資料的興起和WWW與搜尋引擎的盛行頗有關連,WWW盛行後,為因應檢索網頁內容的需要而有搜尋引擎的產生,搜尋引擎運作的方式,基本上是屬於全文檢索,主要是透過自動抓取程式在網際網路上抓取網頁,然後以自動拆字(或詞)作索引的方式來建立其資料庫,做為檢索的基礎,這種操作方式的特點是高運作效率和一網打盡,因此有高回收率與低精確率的特性,這個低精確率的缺點,隨著WWW網頁數量的急遽膨脹,成為無法忍受的致命傷。

很明顯的,我們需要更多的資訊,來從回覆的款目當中,挑選我們真正需要的資料,而這些資訊必須由資料提供者來提供,因此如何制定一套資料描述格式,來有效率的描述收藏的資料,成為一個重要的課題,這正是元資料日漸受到重視的原因。這種對資料須加以適當描述的體會,正是圖書館製作目錄的動機,於是這個古老的經驗又得到再一次的肯定。

都柏林核心集(Dublin Core)是一個簡單有彈性,且非圖書館專業人員也可輕易了解和使用的資料描述格式。這種簡單有彈性和適合各種專業人員的特性,正是它在國外越來越受到歡迎的主要因素,也是作者特別青睞都柏林核心集的原因,這是因為作者同時具有圖書館學和電腦的背景,了解到在現階段,一種適合各專業人士的簡易元資料的必要性;一方面傳統的機讀編目格式過於繁瑣,也繼承太多的傳統包袱,同時傳統圖書館的著錄方式並不適合非圖書館專業的人。另一方面以作者對目前人工智慧、類神經元網路、模糊邏輯等相關學科的了解,知道創造一個具有現今一般圖書館員智慧的自動化系統,在現階段仍是一個遙不可及的夢想,因為至今我們連模仿一個三歲小孩說和聽故事的智力都有困難,更別說是模仿一個成年的專業人士。所以綜合來說,在現階段資料的描述仍需以人工作業為主,同時以今日網際網路上資料膨脹的速度來看,光靠圖書館員來處理是不夠的,由(眾多專業的)文件或資料的創造者本身來自行加以描述,已是必然的趨勢,這正是類似都柏林核心集這種元資料受重視的原因。

以都柏林核心集在國外的發展現況來看,1997年10月的第五次研討會已有專門的議程來針對都柏林核心集的實作系統進行展示和討論,這是以前四次研討會所沒有的,也說明都柏林核心集已漸趨成熟和受到肯定。除了已開發系統的介紹外,也有一些正在籌建中的都柏林核心集相關系統的宣佈,以下是它們的簡介:

(一) 丹麥政府決定自西元1997年起將所有政府的出版物上網,系統的主要規格之一,是採用都柏林核心集來描述文件和協助查詢。

(二) 荷蘭國家圖書館將發展一種新的全球資訊網服務,系統的主要做法是要在所有已蒐集的網頁中,加入都柏林核心集的資料,新的網頁將要求提供者先自行加入都柏林核心集的資料後再送呈,將來荷蘭國家圖書館的搜尋引擎會利用這些元資料來協助檢索。

(三) 英國的UKOLN正在推行一個名為BIBLINK的計劃,在出版社和國家書目中心間建立一條網路通訊管道,來直接交換書籍紀錄和資訊,這套系統是使用都柏林核心集作為其基本的格式。

(四) 在商業的應用上,一個稱為STARTS的協定正在發展中,它可以辨識網頁中的元資料,來協助使用者過濾和排比查詢的結果,STARTS已決定包含都柏林核心集。

綜觀以上的發展,顯示都柏林核心集已漸成熟和廣受肯定,以系統的實作而言,歐洲和澳洲(請參見下面第四章中關於DSTC的介紹)可說是居於領先的地位,歐洲較注重都柏林核心集在圖書館相關服務上的應用,澳洲的DSTC則較偏重都柏林核心集在WWW相關服務上的應用。

由於類似都柏林核心集這類的元資料正逐漸獲得肯定和使用,因此相關的攜帶工具也成為研究者注目的焦點。這是因為元資料的種類複雜且用途殊異,將來多種元資料共存共榮的局面已成為共識,因此一種可同時攜帶多種元資料來往於網際網路和WWW上的架構,成為不可或缺的工具。基於此種認知,W3C乃主導和結合多個元資料團體發展出「資源描述架構」(RDF)。雖然在第二次都柏林核心集的研討會中,也提出一個類似的多個元資料的攜帶工具─「瓦立克架構」[註 19],但是由於W3C在網際網路和WWW界的影響力甚鉅,作者預期RDF終將獲得採用而取代「瓦立克架構」,成為攜帶都柏林核心集的主要工具,因此撰寫本文來介紹資源描述架構在都柏林核心集的可能應用方式。

Google如何靠語義網擊敗EBAY和AMAZON?

August 2009: How Google beat Amazon and Ebay to the Semantic Web
July 26, 2002 By Paul Ford

一個虛構的故事,關於語義網的劇本。2009 年商業雜誌上的短篇特寫。請注意這篇文章是2002年寫的。

這真讓人難以置信,Google(現在世界上最大的獨立在線交易市場) 在僅僅8年多一點的時間就登上了舞台, 過去那可是Amazon和Ebay的統治領域。怎麼Google 就成為了世界上最大的獨立在線交易市場呢?

很好,簡而言之,答案就是「語義網」(一會兒我再告訴你這是什麼)。當Amazon和Ebay各自繼續以每季贏利10億和18億美元的時候,任何人都認為這是成功的,但Google在網絡交易市場每年盈利170億美元則被認定是更加成功的故事,前所未有的——「新經濟」。

Amazon和Ebay都努力開發虛擬交易市場:他們盡可能地外包庫存。然後,通過各種各樣的方法,把買主和賣主吸引到同一件商品上,從交易中抽取利潤。

對於Amazon來說,那意味著售賣新(商品)項目,或者允許眾多用戶賣出他們使用過的商品。對Ebay而言,它意味著把招標人和買主吸引在一起。一旦你被吸引進來, 這種途徑是極其有利潤的,它還是快速的,通過電話、電子郵件和數據庫管理。這很有效。

再來看看Google。在2002 年以前, 它是一個搜索引擎,依靠其廣告盈利。與此同時, 自1998年以來,「語義網」的理念獲得了少數人的關注,並吸引了與日俱增的這個圈子的人們。

什麼是語義網呢? 在其心臟部分, 這僅僅是一個以計算機能理解的方法來描述事物的;當然,它並不理解這是怎麼一回事,而是邏輯,就像在高中學的:

如果A是B的朋友, 那麼B就是A的朋友。
吉姆有一個朋友叫保羅。
所以,保羅有一個朋友叫吉姆。

使用的標記語言叫做RDF (在這兒是首字母的縮略, 因此你不妨學會它——它代表資源描述框架規範Resource Description Framework), 你可以把這樣的邏輯語句放到互聯網上,「網絡爬蟲」就能收集它們,並且語句能被搜索、分析、處理。它與正常搜索不同之處是, 語句可能被結合起來。所以,如果我在吉姆的站點上看到一句話「吉姆是保羅的朋友」,這時有人搜索了「保羅的朋友們」,即使保羅的網站沒有提到吉姆, 我們也會得知吉姆認為自己是保羅的朋友。

我們肯定也想知道其它的事情?比如A和B都是汽車賣主,但A賣的Miatas車比B要便宜百分之十。比如Jan Hammer 70 年代在Mahavishnu Orchestra專輯中使用的keyboards樂器。比如狗有爪子。比如你要求一台特殊型號的電腦,擁有新的主板和更快的總線,可以被升級到奔騰18。語義萬維網不是關於頁面和鏈接的, 它是考慮事物之間聯繫的——是否一件事是另一件事的一部分, 或者東西多少錢, 或什麼時候發生。

語義網最初只是作為Web缺乏「聰明」的補充——並且許多早期工作就像是安排日程和計劃, 和表述人與人之間的關係。在2003年末以前, 當Google 開始在語義網開發上作了一系列實驗的時候 (二年以後進入了他們的研究實驗室),這仍然幾乎是沒有人瞭解,並且很少人經常使用的東西, 除了在邏輯、計算機科學、人工智能方面有基礎知識的研究員。科研曲線象峭壁一樣陡, 並且對於編程人員來說,並沒有足夠的刺激來值得攀登它,也沒有從新的優勢中來研究世界的吸引力。

未來被描述的語義網,會使你更加容易預定牙醫的時間, 更新你的計算機, 檢查培訓計劃, 和協調汽車零件的發貨(時間)。它會使尋找東西更加容易。或許包括所有巨大的東西,巨大到以百萬美元起價。但不敢肯定對習慣於寫支票的人是否有足夠的誘惑, 特別是在他們經歷了95次的.com破產之後。他們看見的所有都是Web——(使他們損失了)幾個口袋和幾百萬的金錢——只不過有個「語義」在它前面修飾罷了。

Semantics vs. Syntax, Fight at 9

一件事物的語義與它的意義相關。它是一個很是模糊的東西,但是在人工智能的世界裡,這個目標將會是從句法中得出語義。至關重要的問題在於,如果你有一大堆東西整齊的按照句法規則排列成能為計算機所識別的結構,你又怎麼能從中得到意義呢?句法學如何成為語義學?人腦對此非常在行,但是對於計算機來說則是困難異常。他們對於句法感到頭疼。只要你用結構化的表達方式,就可以告訴他們任何事情,但是他們卻無法得到意義。他們會將「身有餘而心不足」這句話翻譯成「肉裡面充滿了星星但是伏特加酒是用粉紅色的羽毛做成」,像俄語一樣。

所以人們猜想,只有從句法合理的語句中才能得到真正令人感興趣的東西。實際上,你需要的是一個價值連城的腦袋。現在沒有人能證明這種方式的有效,而它的倡導者則是CYC公司的一個名叫Doug Lenat的人,他早就上了Ashcroft主席的黑名單,被視為一個危險的知識分子,已經好久沒有他的影子了。但是這些關於語義網的基本卻令人深思的概念,直到現在仍然有著影響,即通過從多個人那裡同時獲得句法,進而在他們的集合中獲得意義。

正如你所知道的,電腦仍然在聽我們的話。但是當語義網技術成熟發展起來以後,這些中心化的數據庫——例如Amazon和Ebay,他們都是有著眾多子條目的中心化數據庫–將會散落到網絡的每一處。每個人都將會有自己的那一份數據庫,他們自己的迷宮。發佈這些數據很容易,但是問題在於如何將他們聚合在一起。即使對於一些程序員來說,創建一份RDF文件也是很困難的。

這些都將會逐漸的改變,到了2004年的,Google將會有三種服務:Google市場搜索,Google個人代理和Google認證經理,以及一個軟件:Google市場經理。

Google的市場交易搜索

市場搜索位於Google語義搜索特徵的最重要的部分,而且差不多每一個瀏覽它的人至少會使用一次。你僅僅需要簡單地鍵入:

出售:「馬丁」牌吉他

來看看想買馬丁牌吉他的人的名單

購買:「馬丁」牌吉他

這是用來察看賣方的名單。

Google要求並且記得:你的郵編、按照價格組織的吉他名單中使用簡單的排序控制、狀態、型號、新的還是用過的,以及接近(的價格)。頁面是由Google的「傳統」非語義Web搜尋工具產生的,考慮在Web上長期最佳的匹配,並鏈接到馬丁型號和買者嚮導的信息,以及Google用戶新聞組的文章。還會鏈接到Epinions這樣的站點以彌補紕漏。

因此Google 市場搜索在哪裡得到信息呢?Google是以相同的方式找到它所需要的信息的——通過爬遍它找到的所有網絡和索引。而現在,它正尋找RDDL文件,它會指向RDF 文件,包含這樣的邏輯語句:

(Scott Rahin)住址的郵政編碼 (11231)
(Scott Rahin)電子郵箱地址(ford@ftrain.com)
(Scott Rahin)擁有(馬丁吉他)
[Scott的](馬丁吉他)型號是(245)。
[Scott的](馬丁吉他)可以在(http://ftrain.com/picture/martin.jpg)這裡看見
[Scott的](馬丁吉他)價值(900美元)
[Scott的](馬丁吉他)狀況(良好)
[Scott的](馬丁吉他)可以被描述成「保存得很好,並且很少玩(傷心啊!)。美妙,圓潤的聲音和一套多餘的吉他弦。我很高興能向順便拜訪的人展示它,或者在紐約市內的任何地方交付它」。

理解上面語句最重要的部分不只是在方括號和圓括號之間,而是指針。(Scott Rahin)是指向http://ftrain.com/people/Scott的一個指針。(馬丁牌原聲吉他)是指向URL的指針,它會反向參考包含其他邏輯語句的專業知識數據庫,像這樣:

(馬丁吉他)是一把(原聲吉他)。
(原聲吉他)是一把(吉他)。
(吉他)是一種(樂器)。

這意味著如果有人想搜索吉他,或者原聲吉他,所有的「馬丁吉他」能被納入搜尋範圍中。並且那表明Scott可以說他有「馬丁」或「馬丁吉他」,然後計算機為他計算出其餘的部分。

實際上,我剛剛對你說了謊——它確切來說不是按照那種方式運行的,並且使用指針時會產生許多歧義,並且甚至動詞短語也可能是指針,但是總比湧現出很多術語要好(諸如:namespaces, URIs, prefixes, serialization, PURLs……)。我們將略過那個部分,僅僅關注必要的事實:在語義網中的一切描述都是有URL的(或者URI之類)。真正的意思是說RDF是關於網絡數據的數據(或者叫元數據)。有時RDF會描述其他的RDF。因此你看到了怎樣使用全部語法的陳述,並且希望建造能自己思考的語義網嗎?綜合像那樣的陳述?是嗎?現在真的跟上(我的思路)了?是的,沒有人做這個。

因此Google 使用爬過RDF並建立索引的方法把每個人都聯繫在一起。當然,連結匿名的買主與賣主是不夠的。還需要是有信譽評估。輸入「網絡信譽評估和等級框架」,會顯示各種各樣的信譽評估框架,但是最後這個會被W3C認證(在麻省理工學院和ECMA的核事故之前),它現在是標準。他怎樣運行呢?像這樣:

在Kara Dobbs的站點上,我們找到這樣的敘述:
[Kara Dobbs]說(Scott Rahin)是(可信任的)。
在James Drevin的站點上,我們找到這樣的陳述:
[James Drevin]說(Scott Rahin)是(可信任的)。

等等。很好——但是你怎樣知道如何首先相信別人?
跟著我的思路:

在花旗銀行的站點上:
[花旗銀行]說(Scott Rahin)是(可信任的)。
在萬事達卡的站點上:
[萬事達卡]說(Scott Rahin)是(可信任的)。
然後在Google裡面:
[Google信譽評估服務]說(Scott Rahin)是(可信任的)。
並且如果
[花旗銀行 ]說(Kara Dobbs等人)都是(可信任的)。

然後你開始看出來它們全都是一致的,哪怕別人有一丁點的不誠實,你都會知道,實際上這種感覺很好。現在,如果關於信譽評估、真實的狀況、人類行為種種問題上升到10億個,我們不必需要查看30萬億個頁面,只相信它現在起作用就可以了。並且這一類的許多其他材料就像這樣子:

[美國社會保險管理機構]說(Pete Jefferson)在(1992)年出生。

這表明Pete Jefferson能從因特網中下載成人的錄像和視頻遊戲,因為他19歲了並且有一個社會安全號碼。無論如何,不能給未成年人授予安全號碼。並且不能忽視市民們通過自由分支的表述:

[Sherriff,來自德克薩斯的達拉斯]說(Martin Chalbarinstik)是一個(性侵犯慣犯)。
[Sherriff,來自德克薩斯的達拉斯]說(Dave Trebuchet)有一個(退回支票)。
[美國,綠黨]說(Susan Petershaw)是一名(成員)。

數據庫具有很強大的能力,它們集合的數據非常之多,它們還能關涉隱私,但是不允許作者利用冷酷的機器通過毫無根據的描述,來破壞我們的公民自由權,讓我們繼續前行。

無論如何,當你考慮它的時候,你看出Google為什麼總能很自然地把它們集合到一起。Google已經搜索了整個網絡。Google已經有數千台獨立的機器構成一種分佈框架。Google已經在頁面中找到了鏈接,這是建造它的索引的方式。 Google的搜索引擎用數百萬個變量解決方程式。在RDF裡語義的網絡內容,正是另一個搜索問題,另一套方程式而已。主要的問題在於首先得到信息;想出用它做什麼;從所有的工作中贏利;並且保持它被更新……

Google 市場經理

嗯,首先你需要信息。不過要人們僅僅在一台服務器上找到它,就好比一場混亂——因此讓我們看看「Google市場經理」,一個為Windows、Unix和Macintosh設計的小軟件。市場經理,或者簡稱MM,看起來像一張有規律的電子錶格,允許你列舉關於自己的信息,你想要出售的東西,你想要買的東西……它基本上是一名「邏輯語句的編輯」,只不過偽裝成一張電子錶格而已。人們輸入他們的名字,地址和其它關於他們自己的信息,然後,他們輸入正出售的東西,MM就會保存成RDF 格式文件,傳遞給他們選擇的服務器 ——並且把一個「連接測試程序(ping)」告訴Google,從而不斷改進他們的索引。

當它被開發出來的時候,MM真具有魔法般的魅力。假如你想出售一本書。在分類中你輸入「書」,MM就會查詢開放產品分類法,然後返回詢問你,它是否是一本精裝書、平裝書、用過的、新的、收集的等等。開放產品分類法本質上是一個結構化辭典,並且它將迅速成為描述出售產品的絕對標準。

然後你把書背面ISBN 號碼輸入進去,確認一下,MM就會自動返回填寫作者、版權、頁數和簡介——它只用RDF查詢了一下服務器,獲得它,計算它,返回給你。 如果你是一個小的出版社,你可以列舉你的目錄。如果你有《憤怒的葡萄》的第一版,你可以描述它並且給一個最低的可接受價格,它將在Google拍賣分類中出現。當Google 解釋被輸入的描述、大概符合電子錶格中的東西時,MM的多數小巧的功能實際在那些服務器上。如果你輸入汽車,它會詢問你顏色。 如果你輸入酒,它會詢問葡萄收穫期、葡萄園位置、多少瓶酒。然後,當某人尋找1998的Merlot酒時,你的葡萄酒信息就會列在目錄頂端。

你也能通過MM為高額時段或者大宗項目購買廣告,並且能跟蹤這些廣告的投放情況;它在漂亮的桌面上被全部升級和更新。你也能在網絡上隨時察看同步數據,但是使用MM是美好、快速、最優的。 當你買東西時,它在你的「購買」欄裡列舉項目,通過購買商品的類型來排列,這樣很容易打印出賬目,並為你和那好地記錄下來。

因此,就像我們說過的,Google允許你尋找買方與賣方,然後,使用一種「厚臉皮」的服務從無所不在的貝寶複製過來,交易的費用是1.75%。當然,人們能通過寄支票或者當面交付的方式避免1.75%的費用,但是對大多數交易來說,使用迅速而便宜的服務很不錯——1.75%費用加上投遞廣告和能到達全球的範圍,並且你能通過賬戶平穩地流動數百萬美元。

Amazon和Ebay,還記得它們嗎?無疑地看到了這項新產品並且意識到了他們所處的困境。為了去和Google競爭,他們必須「開創自己的商業模式」——把他們的數據庫交給不可理喻的網絡。因此,在「最優秀公司風格」的掩飾下,他們兩面下注並且什麼也沒做。

儘管他們很低調,但不久之後各種各樣的服務競相出現,就像Google一樣搜索了相同的數據,提供更便宜的交易價格。但是Google有品牌、信任和利潤。

超過100萬的個人在2年內接受並且開始使用新的服務——基於語義網購物。在這2年時間,Google大約有3億美元的資金流動——其中交易的淨額達450萬美元。但是,就像Ebay和Amazon曾經強迫消費者把生意帶到網絡上面來,口頭傳播開始發揮它的魔力。自從尋找想購買的東西變得容易了,並且MM也很容易下載和運行,到2006年訪問Google市場交易的人數增長到1000萬。

Google個人代理

現在,搜索已經不能滿足人們的需求了,還需要服務。你需要計算機幫助你。因此Google也開發出個人代理——本質上,它是一個經常查詢Google的小軟件,當它發現你正在語義網上尋找什麼時,就會寄給你電子郵件。

想知道哪個服務的電話資費更便宜?問問google代理吧。想知道Wholand主題公園什麼時候會在倫敦以外開放?問問google代理吧。或者你的妻子什麼時候更新她網絡上的日程,或者MSFT的價格什麼時候會上升到3 美元,或者加納的政治局勢什麼時候會觸到火線。你甚至能編程序讓它為你談判——如果它發現一本首版完好的《Paterson》在2000美元以下,它會先出價低於詢問價500美元,然後從那兒往上一點點提價。在你和賣方之間是匿名的,如果你有正確的帳號它甚至是免費的,沒有人從中勒索。反而,不使用它買東西會被認為落伍了。就像普通Google搜索與語義網命題邏輯的協商,個人代理也做同樣的事情——根據預先確定的規則,它每隔幾分鐘就以獨特的方式這樣做。

Google認證服務

最後,Google意識到他們能通過提供認證和分等級服務,來實現「真實的網絡」的想法,回答一張調查表需要每年15美元,其中有你的信用調查,還要填入一些銀行賬戶信息。但是人們會註冊它,因為Google就是市場;贊成Google的更甚於對政府的信任。

你的點對點「陪審團」

因為全部信息都以RDF形式存在,Google自己的策略會考慮利用它。Google市場經理的免費克隆版本開始出現,其他搜索引擎開始連1.75%的手續費都削減了,努力找到其他的收入模式。點對點模式一直是MP3和OGG格式的最愛,回到包括實時銷售數據集合中,傳遍成千上萬台志願者的機器——Google也使用相同的模式,卻是個人分佈式的模式。Amazon和Ebay開始在站點上自動包括已收集的RDF數據,削減了一切花費,使它與現有拍賣和待賣物品相結合。

在2006年,花旗銀行Drop Box賬戶開戶費從100美元/月,然後30 美元,然後15 美元,一路下降到5美元/月。Drop Box賬戶由唯一號碼認證,並且只能得到存款(後來能轉移到其他賬戶和存錢了)。它們甚至有URL地址,並且使用金融轉移協議。輕輕一點你的瀏覽器到account://382882-2838292-29-1939,然後輸入你想要存的錢數。只要不遺失drop box號碼就不會有風險,而且不用花手續費。銀行在聯邦監督契約帳戶裡保存了存錢的信息。任何人能公開他們的銀行帳號,根本不用中間人就能出售他們的東西了。

就像音樂公司以前一樣感受到了壓力,他們的目光轉向了點對點市場,Google把費用下降到1%,允許MM用戶使用Drop Box賬戶,並且對MM軟件和服務的購買者每年收取25美元,而對使用者仍然免費。在緊張的幾個月過去之後,Google發現多數用戶出售的東西超過十個,他們很高興買這品牌的產品;但點對點網絡被認為不那麼值得信任,人們認為它是與Google廣告相聯繫的。Google也意識到他們也能提供Drop Box賬戶,並且把它們捆綁在股票和金融市場商業賬戶上,它使得我們跨過了複雜而未獲解決的問題。如果你對此感興趣,就去讀讀Tom Rawley的《The Dragon in the Chicken Coop》吧。

Google的金融服務當然能自動被插入你的MM股票交易中;現在它們正已25000倍的收入做生意,預示著「新新新新經濟」消息的來臨。你在這兒得不到這樣的預示;當他們一旦把它做成了,競爭將是殘酷的。Google在過去不到十年的時間裡是夢幻公司,但是他們最終會減慢速度,這正是完成他們的哲學博士論文的時候。並且我確信他們會這樣的。

一個恐怖的語義化未來?

未來語義網的文化將很難處理。隱私是被密切關心的,但是保留太多的隱私卻無益。記得那些分類法嗎?嗯,一群人在開曼群島之外研製一種「魔鬼分類法」——一種特殊牌子遊艇的內部零件的辭典目錄,但是除了在紙上,實際上建立遊艇的公司從未存在過。他們其實是武器和藥品走私組織。當某人說」裝配」時,意思是大火力的自動步槍。厚帆布是可卡因。一台發動機是武器級別的钚的別稱。

因此,你在與一位妄自尊大的非洲共和國領導人在革命期間會面時,你僱用了一名移居國外的俄羅斯科學家,你的銀行賬戶內有販賣海洛因得來的60億利潤,並且你需要買一些武器級別的钚。誰來為你做這事兒?Google 個人代理,表面上你只不過為遊艇買了一台新發動機而已(雖然1800萬美元稍微有點貴)。如果你正通過「魔鬼分類法」出售鋁制咖啡壺——或者應該叫做蠻純的海洛因。你可能說,因此你彌補了這種差別。

突然作為犯罪策劃者的最大的問題產生了——發現從沒出賣你的那個賣方跑路了。由於那麼多賣方,你甚至能討價還價。出售钚就像出售馬丁吉他那樣順利、簡單、匿名。這難道不能發生嗎?一些人說它能,並解釋說Mandatory Metadata Review法案正在國會的審議議程中,全部RDF必須被引向公眾分類法。就像那個人所說的,你可以生活在有趣的年代。這是誰說的?在Google上查查吧。

BLOG外掛-2008年365天寵物顯示日曆

這是由http://www.365calendar.net/提供的部落格外掛,包含了裡頭有網友們投稿的各種類型寵物,包含狗狗,貓,兔鼠,鳥兒們的寵物照片,他們收集了365張會員們投稿的寵物照片,讓你每天在外掛裡都可以看到不同的寵物照片,此外投稿數目較多的狗狗類,甚至還有分犬種,你可以選擇自己喜歡的犬種或是綜合類的日曆來掛,是喜歡寵物的你不能錯過的部落格外掛喔!
2008年日曆外掛分為:狗狗(全部綜合或單一犬種)、貓、小型寵物(兔鼠類)、鳥兒,每天照片都會不同

網址及語法:http://www.365calendar.net/special/blogparts.html

範例截圖(不知道為什麼小倩的天空部落貼這個出不來):


實際範例:
狗狗全部系列4:

兔兔系列:

2008年2月18日 星期一

什麼是『Pervasive Computing』 (無所不在的運算)?

擷取自: http://www.iiiedu.org.tw/knowledge/knowledge20031231_1.htm
講師: 資策會數位教育研究所講師 劉翰卿


記得,在多年以前有一部電視影集的對話是如此說的:「夥計,快到門口來接我呀!」、「老哥,撐著點,我馬上就到!」沒錯,這就是《 霹靂遊俠 》中的黃金拍檔──是一輛會說話、近乎全能的電腦車。而〝李麥克〞,憑著車上各項尖端設備,勇破各種奇案,打擊犯罪!!
 
您可以利用空檔、在夜闌人靜時分泡著一杯香醇的藍山咖啡,仔細地端詳卡內基美隆大學(Carnegie Mellon University)所發表的兩篇IEEE的期刊文章:『Project Aura:Toward Distraction-Free Pervasive Computing』 、『Aura: an Architectural Framework for User Mobility in Ubiquitous Computing Environments』。賞閱完後,您就會對『Pervasive Computing』一詞有個瞭解,但僅止於概略性的瞭解。關於『Pervasive Computing』一詞有人翻譯成『無所不在的運算』、或是『無處不在的運算』、甚至『普及運算』,然而不管怎麼樣地翻譯,實在難以一語道盡、完美詮釋這一個領域究竟是啥玩意兒,不過倒可從字面之意猜出它應該是跟我們未來的生活是息息相關的,而且是科技享樂主義者所樂觀其成的。

不知您是否和我的經驗一樣,在腦海中對Pervasive Computing所浮現的第一印象竟是霹靂遊俠的精彩畫面,以及許久以前所學過的CORBA規格,透過IDL作為互通的機制。不過,在仔細閱讀完這兩篇文獻的內容後,尤其在看完闡述Aura 的架構的篇幅後,突然又驚覺到好像跟我想像中的景象又有那麼地一點點不一樣。於是上網查詢了一些關於 Pervasive Computing 的一些主題資訊,才瞭解到Pervasive Computing/Ubiquitous Computing Environments(無所不在的運算環境)其實是很廣泛的,卡內基美隆大學所作的專案研究〝Aura〞只能算是其中的一小環而已。在中國大陸有學者提出〝筆式使用者界面開發工具〞研究、在歐美等先進國家又有人對〝可穿戴式的運算〞等進行相關的研究;不斷摸索中,直到看完了在家中Download了近兩個小時卡內基美隆大學所拍攝關於的Project Aura 的影片後,才意會到 “Aura” 它所代表的真正意涵。

的確,根據Moore's Law(摩爾定律)(*註一),未來電腦系統中最貴重的資產可能不會再是 CPU、記憶體、磁碟容量、或網路頻寬等等資源,取而代之的是人類的〝注意力(attention)〞。讓注意力集中,免於因繁複的電腦系統操作、效率等等問題而使得人類寶貴的注意力分散,造成不必要的危險或風險之發生;同時,有了注意力,才有機會發揮更大的創造力與想像力,激發出無窮的潛力,締造出更燦爛、絢麗與便利的美
好明天。而在這兩篇文章中提及一些重要課題,就是剛剛所述跟我想像中不太一樣的地方,這也促使我上網花了一些時間來予以釐清的觀念。
Current approaches to user mobility are based on one of four techniques, none of which fully achieves these goals.

1.
Support as much of a user’s computing needs as possible on a mobile machine.

2.
Compute via remote access to a computing server that stores a users personal state and preferences, much as X-terminals
do.

3.
Provide standard applications that are ported to and installed
in all environments. Those applications are extended to become
aware of user intention and mobility.

4.
Provide standard virtual platforms (such as the Java Virtual Machine) that enable mobile code to follow the user as
needed.


曾看過一份雜誌,它是如此描繪的:『五月天的下午,開著冷氣您乘坐在舒適豪華的Jaguar愛車裡,優雅舒適地徜徉於信義計劃區網狀的市區道路中,意氣風發的您不必為了惱人的單向、雙向行車問題而迷路或為了工作分派的問題而煩惱,因為您的車載電腦更勝於您美麗的女助理。“哈囉”,隨著熟悉的聲音,它提示您:30分鐘後您在台北101世界超高摩天大樓將有一個約會,並顯示從目前位置前往的路線圖,車程時間為20分鐘。您告訴它說“瞭解”,並結束對話。“哈囉”,它又提醒您,走另一條路,車程可能會多個10分鐘,但您可以順道買一杯您喜歡的StarBuck拿鐵咖啡。“謝謝您”,您爽朗的回答,您喜歡這個超人性化的提議。但您可能會因此而遲到,怎麼辦呢?不用擔心,它(您的夥計)早就為老哥您設想週到地送出一個簡訊給您的約會對象,您可以從容不迫地到達目的地就好!不必為了些微的耽擱而焦慮。畢竟,台北市長曾說過:行車安全最重要的啦!』

的確,這就是未來的IT應用,它不僅可以隨時隨地溝通資訊,還瞭解您的個人需求,它將是您最安全、最可信賴的伙伴。未來技術發展的兩大趨勢是無處不在的運算(Pervasive Computing/ Ubiquitous Computing Environments)和無線網絡服務。未來的基礎設施是看不見的,將來人們不用關心電腦,只需考慮與什麼人、做什麼事?要實現這個目標需要的正是時間。就正如今天我們家裡的水龍頭打開就有水,甚至還可能是您所需求溫度的水;透過一張票卡,悠遊台北甚至可以台灣各地走透透等等,而這一切就需要基礎管道的鋪設。對IT來說,這就是網絡服務。 而當今,全世界約有70%的資訊存放在資料庫中,我們必須有更強勁的方式去釋放這些資訊,有更簡單的方式去使用這些資訊,更有效率的方式去發揮這些資訊。有統計顯示,善用網絡服務可以使企業的成本降低40%。

與此同時,我們看到技術推動著所有人的生活,如藍牙連接PC,加上本地裝置,GPRS、3G等,無線連接、無處不在的運算可將不同的硬體連接在一起,裝置愈來愈人性化,體積越來越小,價格愈來愈低,功能越來越豐富。網絡服務將這些無處不在的裝置連接在一起,將資料帶入生活並進行整合,實現與外界的連繫。這就使得無處不在的運算環境不僅在企業工作中,甚至在日常生活中亦可使得資訊可以隨時隨地、隨心所欲的傳送。這種新的技術核心將成為我們生活環境的一部分,並將改變人類的文明生活。

若您有機會詳閱這兩篇文章的話,大概可以體會到無處不在的運算(Pervasive Computing/ Ubiquitous Computing Environments)算是當前電腦應用技術發展的新興領域,是多種電腦技術的融合,具有重要的理論研究價值和廣泛的應用前景,它將成為電腦應用領域中的一大新產業。
但要實現無處不在的技術環境,則必須要跨越許許多多的障礙與大大小小的鴻溝,包括網絡裝置的整合、可管理性、安全性、對異構平台支持以及可擴展性等等課題。而『Project Aura』才算剛起步而已,未來仍然還有一大段遙遠的路途要走。卡內基美隆大學所提的Aura架構看似簡單易懂(*註二),但實作起來卻是十足的充滿無限挑戰,所要結合的領域(Machine learning、Psychology、……)等等既多且深也廣,且讓我
們拭目以待。

註一:
摩爾定律(Moore's Law)是指:IC上可容納的電晶體數目,約每隔18個月便會增加一倍,性能也將提升一倍。
摩爾定律是由英特爾(Intel)名譽董事長摩爾經過長期觀察發現得之。摩爾定律是指一個尺寸相同的晶片上,所容納的電晶體數量,因製程技術的提升,每十八個月會加倍,但售價相同;晶片的容量是以電晶體(Transistor)的數量多寡來計算,電晶體愈多則晶片執行運算的速度愈快,當然,所需要的生產技術愈高明。若在相同面積的晶圓下生產同樣規格的IC,隨著製程技術的進步,每隔一年半,IC產出量就可增加一倍,換算為成本,即每隔一年半成本可降低五成,平均每年成本可降低三成多。就摩爾定律延伸,IC技術每隔一年半推進一個世代。摩爾定律是簡單評估半導體技術進展的經驗法則,其重要的意義在於長期而言IC製程技術是以一直線的方式向前推展,使得IC產品能持續降低成本,提升性能,增加功能。
台積電董事長張忠謀先生曾表示,摩爾定律在過去30年相當有效,未10
年間應該是依然適用。

註二:
內基美隆大學(Carnegie Mellon University)的專案研究—〝Aura〞概略架構




雲端運算- Wikipedia

雲端運算

雲端運算(cloud computing,分散式運算技術的一種,其最基本的概念,是透過網路將龐大的運算處理程序自動分拆成無數個較小的子程序,再交由多部伺服器所組成的龐大系統經搜尋、運算分析之後將處理結果回傳給用戶。透過這項技術,網路服務提供者可以在數秒之內,達成處理數以千萬計甚至億計的資訊,達到和「超級電腦」同樣強大效能的網路服務。

最簡單的雲端運算技術在網路服務中已經隨處可見,例如搜尋引擎、網路信箱等,使用者只要輸入簡單指令即能得到大量資訊。

未來如手機、GPS等行動裝置都可以透過雲端運算技術,發展出更多的應用服務。

進一步的雲端運算不僅只做資料搜尋、分析的功能,未來如分析DNA結構、基因圖譜定序、解析癌症細胞等,都可以透過這項技術輕易達成。

推廣與發展

2007年10月,Google與IBM開始在美國大學校園,包括卡內基美隆大學、麻省理工學院、史丹佛大學、加州大學柏克萊分校及馬里蘭大學等,推廣雲端運算的計畫,這項計劃希望能降低分散式運算技術在學術研究方面的成本,並為這些大學提供相關的軟硬體設備及技術支援(包括數百台個人電腦及BladeCenter與System x伺服器,這些運算平臺將提供1600個處理器,支援包括Linux、Xen、Hadoop等開放原始碼平臺)。而學生則可以透過網路開發各項以大規模運算為基礎的研究計畫。

2008年1月30日,Google宣佈在台灣啟動「雲端運算學術計畫」,將與臺大、交大等學校合作,將這種先進的大規模、快速運算技術推廣到校園。

雲端運算cloud computing

本文擷取自 : http://mmdays.com/2008/02/14/cloud-computing/

前一陣子在新聞上看到不少有關於 Cloud Computing (雲端運算) 的報導,不過看看台灣的報導似乎都不是相當深入或是明確,於是我興起了寫這一篇文章的念頭。這篇文章是我自己對於雲端運算的理解,還希望各位讀者能一起參與討論,提供不同的見解。有機會的話,我也希望之後能夠繼續寫一些有關雲端運算中所包含的粗淺的技術介紹。

好吧,開門見山:雲端運算不是技術,它是概念。為什麼這樣說呢?因為 cloud computing 本身並不代表任何一項資訊科技的技術,它是一種電腦運算的概念,而一種概念就會有許多不同的方式去實踐,這個時候才會有不同的技術衍伸出來。就好像我們聽過 pervasive computing、ubiquitous computing、parallel computing 一樣,這些都是運算的概念,不是單指一項特定的技術。cloud computing 也不例外,它本質上就是代表分散式運算 (distributed computing) 的概念。而分散式運算說穿了,就是讓一些不同的電腦同時去幫你做事情、進行運算,所以你有兩台電腦也好、十萬台電腦也好,只要你有超過一台電腦,而且讓他們可以互相溝通,一起同時幫你做事情,恭喜你,這就是分散式運算。


好吧,如果雲端運算不過就是分散式運算罷了,故事就這樣結束也太沒意思了。那我們就繼續從其他名詞的出現繼續看下去好了。

大家可能同時也聽過 grid computing (網格運算) 這個名詞,相信滿多人覺得網格運算跟 cloud computing 很像。其實 cloud computing 在概念上跟 grid computing 並沒有非常嚴格的區隔或是很大的不同,兩者均可看成是 distributed computing (分散式運算) 衍伸出來的概念。grid computing 一詞出現得較早,將重點的概念放在異質系統之間運算資源的整合,簡單來說,就是讓不同等級的電腦、或是不同作業系統的電腦,彼此之間可以透過通訊標準來互相溝通,分享彼此的運算資源。在網際網路還沒有今天這麼發達之前,企業採用 grid computing,很大的原因是為了讓組織內部的 IT 資源達到更良好的使用率。

當大家努力去實現這樣的一個概念時,其實就促成了網際網路的蓬勃發展,因為網路本身就是在強調不同電腦之間的溝通以及合作,於是在各項基礎設施包括頻寬、通訊標準、電腦運算能力以及運算架構都逐漸發展成熟之後,提供給開發者或是一般使用者的網路服務便開始出現,這些網路服務 (Web Service) 提供給使用者簡單的介面來存取一些資源。當然一開始的時候,企業提供出來的,都是一些相當陽春的網路服務。

這些 Web Service 繼續發展下去,時至今日出現了像 Google、Yahoo!、Amazon 等等網路巨獸,這些大公司有能力去購買數以萬計的伺服器,並且把這些電腦串起來,成為一個龐大的運算資源。而龐大的運算資源自然就意味者更為多樣化和以前無法提供的新服務。所有的人現在可以在網路上不同的地方,利用各大企業開放出來的運算資源,進行資料的運算或是提供服務給使用者,於是就在這樣的情況之下,cloud computing 被提了出來。因為現在無論是一般的使用者或是開發者,都透過網路來取得資料或是進行資料運算,自己本地端的運算資源雖然有限,還是可以透過網路進行複雜的運算,結果資料就像是從天上的雲端掉下來一樣,相信學資訊的讀者都對於將網際網路表示成一朵雲的圖示不會陌生。例如下圖:




所以在我看來,cloud computing 並不代表任何單一技術的突破或是革新,它代表的是分散式運算本身的一種成熟,就好像我們看到網路發展到一定程度了,就有人喊出了 Web 2.0,都是一樣的道理。

Google雲端運算計畫 來台找創意

新聞辭典》雲端運算
【經濟日報╱記者何佩儒)】 2008.01.30 04:06 am
雲端運算(Cloud Computing)是Google為了處理成千上萬、散見全球各地的個人電腦與伺服器資料,所開發的運算模式,由於Google的企業精神是開放,Google也是透過開放原始碼的模式讓各界運用。

舉例來說,當網友登入Google的帳號及密碼,全球有數百台的電腦會同時運作,在很短的時間內確認資料。這些龐大的網路資料,密密麻麻交錯如同天上的雲一般,雲端運算的模式,就是要讓開發者學會同時讓數百台、數千台電腦運作,提高其運算的速度。

目前美國就有一些新創網站,開發出有創意的服務,由於運用雲端運算,可以服務眾多甚至跨國的使用者,但這些新創網站資金不足以購買許多伺服器,因此衍生出租用伺服器的生意。


雲端運算 網路服務超強超快
【聯合報╱許韶芹】 2008.01.30 08:56 am
雲端運算(cloud computing)最基本的概念,是將龐大的運算作業拆成千百個較小的作業,交給遠端、多台伺服器同時運算。透過這項技術,網路服務提供者可以在數秒之內,處理數以千計、萬計的資訊,並提供和「超級電腦」一樣強大效能的網路服務,以符合眾多網友的需求。

Google搜尋服務、Gmail、YouTube、Google Docs、Google Talk、iGoogle、Google Calendar都充分應用到這項技術。如今Google也秉著開放精神,要將這項技術的開放原始碼軟體和學術界分享。

雲端運算技術在網路服務中隨處可見,例如網路信箱,使用者擁有的大量電子郵件資料不是儲存在個人電腦中,而是儲存在眾多伺服器裡。

還有網路業者提供線上試算表,網友們可以在網路上輸入數值,計算工作也都是靠多台遠端電腦共同運算達成。

未來將進入「資訊離開個人電腦的時代」,如手機、GPS等行動裝置都可以透過雲端運算技術,開發出更多創新服務。

雲端運算不僅廣受資訊業者應用,在生物科學上也普遍被應用,例如分析DNA結構、基因圖譜定序、解析癌症細胞等,透過多台遠端電腦進行運算,比單單使用自己的單機運算,實在是快多了。


Google雲端運算計畫 來台找創意
【聯合報╱記者許韶芹/台北報導】 2008.01.30 04:06 am
全球搜尋引擎龍頭Google昨天宣布,將和台灣大學、交通大學合作推廣「雲端運算學術計畫」,幫助台灣學子學習這項網路開發主流技術。台灣是Google在美國本土外,第一個可望輸出快速運算模式的國家,有助台灣開發更多有創意的網路服務。

Google台灣工程研究所所長簡立峰說,網路資料日漸增多且龐雜,Google開發所謂「雲端運算」(cloud computing)的模式,可讓數百台、數千台電腦同時運作,這項運算概念充斥在日常生活各種網路服務中。

舉例來說,當網友登入Google的帳號及密碼,全球有數百台的電腦會同時運作,幾秒內即能確認。而且上千封郵件不是放在用戶的個人電腦裡,而是儲放在世界各地的伺服器中,這些伺服器就像一朵朵的雲,使用者不知道自己的郵件躲在哪朵雲中。

他表示,在Google搜尋關鍵字,可在不到一秒時間,搜尋出超過十億個網頁,這也和雲端運算有關,原理是將龐大運算作業拆成千百個較小的作業,在多部伺服器上同時動作。Google其他線上服務如Google Docs、Google Talk、iGoogle、Google Calendar都充分應用到這項技術。

他說,只要運算功能是在遠端、多部伺服器進行,本機只負責單純操作的技術,都可以稱為雲端運算。不只Google靠雲端運算起家,Yahoo!、Amazon、微軟也都採用這項技術提升網路服務功能。微軟創辦人比爾蓋茲曾說,未來是雲端運算的時代。

去年十月Google先在美國麻省理工學院、史丹佛、柏克萊加大、卡內基梅隆、馬里蘭和西雅圖華盛頓大學首度推廣,成效不錯。華盛頓大學學生甚至因此編寫出可掃描內容龐大的維基百科,以辨識垃圾條目程式,及根據地理位置編排全球新聞標題。

台灣是這項計畫的第二站,也是Google在美國本土以外的第一站。Google軟體工程師葉平說,Google將提供教材給台灣教授,並協助學校在現有運算資源上建置相關軟體系統,台灣Google還會派六名工程師到大學當學生的小師父。

目前Google已計畫和台大劉邦鋒教授開設的「平行運算」,以及交大教授彭文志和黃俊龍的「Web Services and Application」課程合作。

Semiconductor Companies Use SAS Software Support Engineers for Data Analysis (EDA)

Semiconductor manufacturing is a highly complex process that generates vast amounts of data. From equipment performance to product yield, e...