Text Analytics Toolboxで品詞でフィルタしたものを、Token化するにはどうしたら良いでしょうか？

%% 解析用データの読込み（「吾輩は猫である」を読み込んでいます）
url = "https://www.aozora.gr.jp/cards/000148/files/789_14547.html";
options = weboptions('CharacterEncoding','Shift_JIS');
code = webread(url,options);
textData = extractHTMLText(code);
textData = string(split(textData,newline));
idx = textData == "";
textData(idx) = [];
%% トークン化
documents = tokenizedDocument(textData);
%% 品詞情報の取得
tdetails = tokenDetails(documents);
head(tdetails)
%% 名詞の抽出
idx = tdetails.PartOfSpeech == "noun";
%% 再びトークン化
tokens = tdetails(idx,:);
for ii = 1:max(tokens.DocumentNumber)
    try
        str(ii,:) = join(tokens.Token(tokens.DocumentNumber == ii));
    end
end
documents = tokenizedDocument(str)
documents.Vocabulary

1 Comment
Show -1 older comments Hide -1 older comments

Takafumi Amano on 8 Mar 2021

ありがとうございました。

無事に意図したものができました。

Sign in to comment.

Text Analytics Toolboxで品詞でフィルタしたものを、Token化するにはどうしたら良いでしょうか？

0 Comments
Show -2 older comments Hide -2 older comments

Accepted Answer

1 Comment
Show -1 older comments Hide -1 older comments

More Answers (0)

Categories

Products

Tags

Community Treasure Hunt

Text Analytics Toolboxで品詞​でフィルタしたものを​、Token化するに​はどうしたら良いでし​ょうか？

0 Comments Show -2 older comments Hide -2 older comments

Accepted Answer

1 Comment Show -1 older comments Hide -1 older comments

More Answers (0)

Categories

Products

Tags

See Also

Community Treasure Hunt

Text Analytics Toolboxで品詞でフィルタしたものを、Token化するにはどうしたら良いでしょうか？

0 Comments
Show -2 older comments Hide -2 older comments

1 Comment
Show -1 older comments Hide -1 older comments