Text Analytics Toolboxで品詞でフィルタしたものを、Token化するにはどうしたら良いでしょうか？

%% 解析用データの読込み（「吾輩は猫である」を読み込んでいます）
url = "https://www.aozora.gr.jp/cards/000148/files/789_14547.html";
options = weboptions('CharacterEncoding','Shift_JIS');
code = webread(url,options);
textData = extractHTMLText(code);
textData = string(split(textData,newline));
idx = textData == "";
textData(idx) = [];
%% トークン化
documents = tokenizedDocument(textData);
%% 品詞情報の取得
tdetails = tokenDetails(documents);
head(tdetails)
%% 名詞の抽出
idx = tdetails.PartOfSpeech == "noun";
%% 再びトークン化
tokens = tdetails(idx,:);
for ii = 1:max(tokens.DocumentNumber)
    try
        str(ii,:) = join(tokens.Token(tokens.DocumentNumber == ii));
    end
end
documents = tokenizedDocument(str)
documents.Vocabulary

1 commentaire
Afficher -1 commentaires plus anciens Masquer -1 commentaires plus anciens

Takafumi Amano le 8 Mar 2021

ありがとうございました。

無事に意図したものができました。

Connectez-vous pour commenter.

Text Analytics Toolboxで品詞でフィルタしたものを、Token化するにはどうしたら良いでしょうか？

0 commentaires
Afficher -2 commentaires plus anciens Masquer -2 commentaires plus anciens

Réponse acceptée

1 commentaire
Afficher -1 commentaires plus anciens Masquer -1 commentaires plus anciens

Plus de réponses (0)

Catégories

Produits

Tags

Community Treasure Hunt

Text Analytics Toolboxで品詞​でフィルタしたものを​、Token化するに​はどうしたら良いでし​ょうか？

0 commentaires Afficher -2 commentaires plus anciens Masquer -2 commentaires plus anciens

Réponse acceptée

1 commentaire Afficher -1 commentaires plus anciens Masquer -1 commentaires plus anciens

Plus de réponses (0)

Catégories

Produits

Tags

Voir également

Community Treasure Hunt

Text Analytics Toolboxで品詞でフィルタしたものを、Token化するにはどうしたら良いでしょうか？

0 commentaires
Afficher -2 commentaires plus anciens Masquer -2 commentaires plus anciens

1 commentaire
Afficher -1 commentaires plus anciens Masquer -1 commentaires plus anciens